📖
预训练
训练方法
一句话概括
在海量无标注数据上自监督学习,让模型获得通用语言能力的基础训练阶段。
详细解析
预训练(Pretraining)是大语言模型训练的第一阶段,在海量无标注文本(网页、书籍、代码等)上通过自监督任务进行训练。对于Decoder-only模型,任务是"预测下一个token";对于Encoder模型(BERT),任务是掩码语言模型。
预训练让模型习得语言规律、世界知识、推理能力等通用能力,形成"基础模型"(Foundation Model)。这一阶段消耗绝大部分训练算力(动辄数千GPU月),数据规模达万亿token,成本数百万至数千万美元。
预训练模型可被下游任务复用,通过微调适配具体场景,避免从零训练的巨大成本。预训练数据的质量、规模、多样性直接决定模型上限,是各大厂商的核心竞争力所在。