训练方法/术语条目
预训练
在海量无标注数据上自监督学习,让模型获得通用语言能力的基础训练阶段。
大白话:在海量无标注数据上自监督学习,让模型获得通用语言能力的基础训练阶段
换成大白话
预训练(Pretraining)是大语言模型训练的第一阶段,在海量无标注文本(网页、书籍、代码等)上通过自监督任务进行训练。对于Decoder-only模型,任务是"预测下一个token";对于Encoder模型(BERT),任务是掩码语言模型。 预训练让模型习得语言规律、世界知识、推理能力等通用能力,形成"基础模型"(Foundation Model)。这一阶段消耗绝大部分训练算力(动辄数千GPU月),数据规模达万亿token,成本数百万至数千万美元。 预训练模型可被下游任务复用,通过微调适配具体场景,避免从零训练的巨大成本。预训练数据的质量、规模、多样性直接决定模型上限,是各大厂商的核心竞争力所在。
它通常在什么场景出现
这个术语常见于模型选择、训练与微调、推理与部署、评测或产品功能说明等场景;当你遇到“预训练”时,多半是在讨论模型行为、处理方式或指标口径。
具体出现在哪类场景,可以用下方“跨库查找”搜索包含该概念的模型、训练、评测或产品资料。
容易混淆的地方
不要把“预训练”理解成模型本身的能力或在某个榜单上的具体名次;它更多是描述一种机制、一种处理方式或一个指标口径,而不是模型实力的绝对结论。
来源与更新时间
术语释义来自公开资料和持续维护的目录字段;具体每条定义的最后维护时间与待核实信息,以本页为准。