📖
监督微调
训练方法
一句话概括
用指令-回答对的有标注数据训练模型遵循指令,是对齐的第一步。
详细解析
监督微调(Supervised Fine-Tuning, SFT)是用"指令-回答"格式的有标注数据继续训练预训练模型,使其学会理解和遵循人类指令。它是RLHF流程的第一步,也是构建对话模型的基础。
SFT数据通常为数千到数十万条高质量对话样本,格式如{"instruction": "...", "input": "...", "output": "..."}。数据质量远比数量重要——LIMA研究表明仅1000条精心筛选的样本就能训练出优秀的对话模型。
SFT让模型从"续写文本"转变为"回答问题",是模型行为定型的关键。开源模型(LLaMA、Qwen等)的官方SFT版本可直接使用,开发者也可基于这些模型做领域SFT构建垂直应用。