训练方法/术语条目
监督微调
用指令-回答对的有标注数据训练模型遵循指令,是对齐的第一步。
大白话:用指令-回答对的有标注数据训练模型遵循指令,是对齐的第一步
换成大白话
监督微调(Supervised Fine-Tuning, SFT)是用"指令-回答"格式的有标注数据继续训练预训练模型,使其学会理解和遵循人类指令。它是RLHF流程的第一步,也是构建对话模型的基础。 SFT数据通常为数千到数十万条高质量对话样本,格式如{"instruction": "...", "input": "...", "output": "..."}。数据质量远比数量重要——LIMA研究表明仅1000条精心筛选的样本就能训练出优秀的对话模型。 SFT让模型从"续写文本"转变为"回答问题",是模型行为定型的关键。开源模型(LLaMA、Qwen等)的官方SFT版本可直接使用,开发者也可基于这些模型做领域SFT构建垂直应用。
它通常在什么场景出现
这个术语常见于模型选择、训练与微调、推理与部署、评测或产品功能说明等场景;当你遇到“监督微调”时,多半是在讨论模型行为、处理方式或指标口径。
具体出现在哪类场景,可以用下方“跨库查找”搜索包含该概念的模型、训练、评测或产品资料。
容易混淆的地方
不要把“监督微调”理解成模型本身的能力或在某个榜单上的具体名次;它更多是描述一种机制、一种处理方式或一个指标口径,而不是模型实力的绝对结论。
来源与更新时间
术语释义来自公开资料和持续维护的目录字段;具体每条定义的最后维护时间与待核实信息,以本页为准。