训练方法/术语条目
直接偏好优化
无需奖励模型和强化学习,直接用偏好数据优化模型的简化对齐算法。
大白话:无需奖励模型和强化学习,直接用偏好数据优化模型的简化对齐算法
换成大白话
直接偏好优化(Direct Preference Optimization, DPO)是一种简化的对齐算法,由Meta在2023年提出。它绕过了RLHF中训练奖励模型和强化学习的复杂步骤,直接用人类偏好对(chosen, rejected)通过一个简化的损失函数优化策略模型。 DPO的理论基础是:最优策略可由奖励函数显式表示,从而将奖励学习与策略优化合并为一步分类问题。它训练更稳定、超参更少、计算更便宜,效果在许多任务上接近甚至超过RLHF,因此迅速被广泛采用。 DPO的局限是对偏好数据质量敏感、对离线数据利用不如RLHF灵活、可能过度优化偏好分布。后续衍生出IPO、KTO、SimPO等改进变体。DPO已成为开源模型对齐的主流选择。
它通常在什么场景出现
这个术语常见于模型选择、训练与微调、推理与部署、评测或产品功能说明等场景;当你遇到“直接偏好优化”时,多半是在讨论模型行为、处理方式或指标口径。
具体出现在哪类场景,可以用下方“跨库查找”搜索包含该概念的模型、训练、评测或产品资料。
容易混淆的地方
不要把“直接偏好优化”理解成模型本身的能力或在某个榜单上的具体名次;它更多是描述一种机制、一种处理方式或一个指标口径,而不是模型实力的绝对结论。
来源与更新时间
术语释义来自公开资料和持续维护的目录字段;具体每条定义的最后维护时间与待核实信息,以本页为准。