训练方法/术语条目
人类反馈强化学习
通过人类偏好数据训练奖励模型,再用强化学习优化模型输出的对齐技术。
大白话:通过人类偏好数据训练奖励模型,再用强化学习优化模型输出的对齐技术
换成大白话
人类反馈强化学习(RLHF)是让模型输出与人类偏好对齐的核心技术,由InstructGPT/ChatGPT推广。它分三步:1)SFT得到初始策略;2)用人类对模型输出的偏好排序数据训练一个奖励模型(Reward Model);3)用PPO等强化学习算法最大化奖励模型评分,同时通过KL散度约束防止偏离过远。 RLHF解决了"模型输出有用、无害、诚实"的对齐问题,让基础模型变成可对话、可指令遵循的助手。它使ChatGPT一举成名,成为现代对齐的事实标准。 RLHF的挑战在于偏好数据采集昂贵、奖励模型可能被"钻空子"(reward hacking)、训练不稳定。后续出现了DPO等简化方法,但RLHF仍是高质量对齐的主流方案。
它通常在什么场景出现
这个术语常见于模型选择、训练与微调、推理与部署、评测或产品功能说明等场景;当你遇到“人类反馈强化学习”时,多半是在讨论模型行为、处理方式或指标口径。
具体出现在哪类场景,可以用下方“跨库查找”搜索包含该概念的模型、训练、评测或产品资料。
容易混淆的地方
不要把“人类反馈强化学习”理解成模型本身的能力或在某个榜单上的具体名次;它更多是描述一种机制、一种处理方式或一个指标口径,而不是模型实力的绝对结论。
来源与更新时间
术语释义来自公开资料和持续维护的目录字段;具体每条定义的最后维护时间与待核实信息,以本页为准。