RLHF、DPO 与偏好对齐到底在做什么?

从成对偏好数据到奖励模型、策略优化与直接偏好训练

目录

  很多回答没有唯一标准答案。标注者更容易比较 A 与 B 哪个更好,而不是为每个回答写一个绝对分数。偏好对齐就从这种成对选择开始。

SFT 教模型模仿理想答案,偏好训练教模型在两个可行答案中更偏向哪一个。

RLHF、DPO 与偏好对齐到底在做什么?

第 23 课核心流程,点击查看原始 SVG

1、偏好数据

对同一个 Prompt 生成多个回答,由人类或可靠规则选出 chosen 与 rejected。标准应明确,例如有用、诚实、安全、简洁与格式正确。

偏好标签会继承标注者和采样分布的偏差,因此需要一致性检查。

2、经典 RLHF 流程

InstructGPT 风格流程先做 SFT,再用偏好对训练 Reward Model,最后用 PPO 等强化学习算法优化策略,使奖励升高。

训练通常加入相对参考模型的 KL 约束,避免策略为了追求奖励而偏离语言能力太远。

3、Reward Hacking

奖励模型只是人类偏好的近似。策略可能找到能骗取高分却不真正有用的模式,这叫 Reward Hacking。监控长度偏差、套话、格式漏洞与分布外行为很重要。

4、DPO 的核心

DPO 不单独训练显式 Reward Model,也不在训练循环里运行 PPO。它直接提高 chosen 相对 rejected 的概率,同时用参考模型约束变化。

实现上更像成对分类损失,流程通常更简单、稳定且资源需求较低。

5、RLHF 与 DPO 怎么选

RLHF 能接入更一般的奖励和在线采样,但系统复杂、超参数多。DPO 简洁,适合已有离线偏好对;效果高度依赖偏好数据覆盖与参考策略。二者不是永远谁取代谁。

6、对齐不等于绝对安全

偏好训练优化的是收集到的信号,无法覆盖所有场景。还需要红队测试、事实评估、安全策略、监控和部署后的反馈闭环。模型更会迎合偏好,也可能变得过度拒答或刻板。

容易混淆的三件事

  1. Reward Model 不是真实人类价值。
  2. DPO 不是没有参考策略。
  3. 偏好对齐不能替代安全评估。

记住这 5 件事

  1. 偏好数据常是 chosen/rejected
  2. RLHF 训练奖励模型与策略
  3. KL 约束策略偏移
  4. DPO 直接优化成对偏好
  5. 对齐结果取决于反馈质量

参考资料

第二十三课复习总图

大模型第二十三课复习总图

第二十三课复习总图,点击查看原始 SVG

  最后一课把全部知识放进一个可复现项目:训练、评估并部署一个小型语言模型。