云镜收藏

稍后阅读

清单保存在当前浏览器,方便下次回来继续阅读。

清单还是空的

在笔记卡片或正文页点击“加入稍后阅读”即可收藏。

展开章节与本页目录
十四章问道录01机器学习与深度学习基础02Tokenizer 与表示学习03Transformer 与注意力04模型架构与 Scaling05预训练数据与优化06分布式训练07SFT 与参数高效微调08对齐与推理能力09推理与服务优化10RAG 与检索系统11Agent 与工具调用12评测、安全与幻觉13多模态大模型14编程与系统设计题本章问题01RLHF 的完整流程是什么?02偏好数据应该怎样收集?03奖励模型怎样训练?04PPO 在 RLHF 中优化什么?05优势函数为什么比直接奖励更合适?06KL 约束在后训练中有什么作用?07DPO 为什么不需要显式奖励模型?08DPO 的 beta 控制什么?09GRPO 与 PPO 的主要区别是什么?10规则奖励与模型奖励怎样组合?11Reward Hacking 是什么?12过程监督与结果监督如何比较?13推理模型的 Test-Time Compute 是什么?14后训练怎样防止能力回退?

第 08 章 · 大模型算法岗

对齐与推理能力

连接 SFT、奖励模型、RLHF、PPO、DPO、GRPO 与推理训练,理解目标、数据和稳定性的边界。

14 道核心题校订于 2026年8月31日
RLHFPPODPOGRPO

RLHF 的完整流程是什么?

30 秒口述版

先做 SFT,再收集偏好比较训练奖励模型,最后用强化学习优化策略并用 KL 约束偏离参考模型。

原理与推导

每阶段解决的问题不同:SFT 给行为起点,奖励模型近似人类偏好,RL 在该代理目标上搜索。

公式、代码或工程案例

画出 prompt→候选→偏好→RM→PPO 的数据流。

高频追问

  • 为什么不能直接优化人工评分?
  • 这个结论在规模、数据或硬件条件变化时,边界会怎样改变?

易错点

不要把奖励模型分数当成真实人类价值。

权威来源


偏好数据应该怎样收集?

30 秒口述版

对同一 prompt 的候选做成对排序,并明确帮助性、正确性和安全性准则。

原理与推导

需处理标注者分歧、位置偏差、长度偏好和难例覆盖,保留一致性与置信信息。

公式、代码或工程案例

随机交换候选顺序并设置黄金题审计。

高频追问

  • Pairwise 与 pointwise 反馈如何比较?
  • 这个结论在规模、数据或硬件条件变化时,边界会怎样改变?

易错点

不要把多数票当成无噪声真值。

权威来源


奖励模型怎样训练?

30 秒口述版

输入 prompt 与 response 输出标量,对 chosen/rejected 使用成对 logistic loss,使前者分数更高。

原理与推导

它学的是收集分布上的相对偏好,超出分布时可能被策略利用。

公式、代码或工程案例

写出 -log σ(r_chosen-r_rejected)。

高频追问

  • 奖励模型为何会偏爱长答案?
  • 这个结论在规模、数据或硬件条件变化时,边界会怎样改变?

易错点

不要只看训练准确率。

权威来源


PPO 在 RLHF 中优化什么?

30 秒口述版

PPO 用裁剪概率比限制策略更新,并结合奖励、价值函数与参考模型 KL 惩罚提高稳定性。

原理与推导

策略生成在线样本,critic 估计价值,优势函数降低方差;多项损失共同作用。

公式、代码或工程案例

解释 ratio、clip、advantage 和 KL 四个量。

高频追问

  • PPO 属于 on-policy 吗?
  • 这个结论在规模、数据或硬件条件变化时,边界会怎样改变?

易错点

不要只背裁剪公式而不说明数据来自当前策略。

权威来源


优势函数为什么比直接奖励更合适?

30 秒口述版

优势衡量某动作相对当前状态基线好多少,减去价值基线可降低梯度方差。

原理与推导

序列奖励需分配到 token,GAE 在偏差与方差间折中。

公式、代码或工程案例

A_t=Q(s_t,a_t)-V(s_t)。

高频追问

  • GAE 的 lambda 如何影响估计?
  • 这个结论在规模、数据或硬件条件变化时,边界会怎样改变?

易错点

不要说基线会改变策略梯度期望。

权威来源


KL 约束在后训练中有什么作用?

30 秒口述版

限制新策略远离参考模型,防止为追逐奖励而语言退化或模式坍缩。

原理与推导

可作为 reward penalty 或目标约束,系数过大限制学习,过小增加 reward hacking。

公式、代码或工程案例

监控 token-level KL 与实际生成质量。

高频追问

  • 参考模型通常选谁?
  • 这个结论在规模、数据或硬件条件变化时,边界会怎样改变?

易错点

不要把低 KL 等同于高质量。

权威来源


DPO 为什么不需要显式奖励模型?

30 秒口述版

DPO 将带 KL 约束的偏好优化推导成 chosen/rejected 相对参考策略的分类损失,直接训练策略。

原理与推导

它简化工程但仍隐含偏好模型,并依赖静态偏好数据、参考模型和 beta。

公式、代码或工程案例

解释策略与参考模型 log-ratio 的差。

高频追问

  • DPO 是 on-policy 还是 off-policy?
  • 这个结论在规模、数据或硬件条件变化时,边界会怎样改变?

易错点

不要说 DPO 完全没有奖励假设。

权威来源


DPO 的 beta 控制什么?

30 秒口述版

beta 控制相对参考策略偏移与偏好拟合强度的尺度。

原理与推导

数值含义受 loss 实现和数据难度影响,应结合 margin、KL 与生成评测选择。

公式、代码或工程案例

画出不同 beta 下偏好准确率与 KL 曲线。

高频追问

  • chosen/rejected 概率同时下降正常吗?
  • 这个结论在规模、数据或硬件条件变化时,边界会怎样改变?

易错点

不要只监控 pairwise accuracy。

权威来源


GRPO 与 PPO 的主要区别是什么?

30 秒口述版

GRPO 对同一 prompt 的一组回答按组内奖励归一化估计相对优势,可省去独立 critic。

原理与推导

它降低价值模型显存,但需要多样采样,组内方差小或奖励稀疏时信号会弱。

公式、代码或工程案例

说明 group size、reward normalization 与 KL。

高频追问

  • GRPO 是否天然比 PPO 稳定?
  • 这个结论在规模、数据或硬件条件变化时,边界会怎样改变?

易错点

不要把 critic-free 说成没有基线。

权威来源


规则奖励与模型奖励怎样组合?

30 秒口述版

可验证任务优先使用答案、编译或测试等规则信号,开放任务再引入模型评分,并做尺度校准。

原理与推导

组合奖励要防止某一分量支配,且规则漏洞同样会被利用。

公式、代码或工程案例

分别监控每个 reward component 与总分。

高频追问

  • 长度奖励为何危险?
  • 这个结论在规模、数据或硬件条件变化时,边界会怎样改变?

易错点

不要只优化综合分而不看分量。

权威来源


Reward Hacking 是什么?

30 秒口述版

策略找到提高代理奖励但违背真实目标的捷径,例如冗长、格式投机或利用评判器偏差。

原理与推导

根因是代理目标不完备和分布外优化,缓解需多评判器、对抗测试、约束与人工审计。

公式、代码或工程案例

比较 reward 上升而真实成功率下降的曲线。

高频追问

  • Goodhart 定律如何体现?
  • 这个结论在规模、数据或硬件条件变化时,边界会怎样改变?

易错点

不要把所有高奖励样本都当优质数据回灌。

权威来源


过程监督与结果监督如何比较?

30 秒口述版

结果监督只评价最终答案,便宜且目标直接;过程监督评价中间步骤,可提供密集信号和错误定位。

原理与推导

过程标签成本高且可能约束有效的新推理路径,最终选择依任务可验证性。

公式、代码或工程案例

数学题同时记录 final correctness 与 step validity。

高频追问

  • PRM 如何被搜索使用?
  • 这个结论在规模、数据或硬件条件变化时,边界会怎样改变?

易错点

不要把可读推理文本等同于模型真实内部推理。

权威来源


推理模型的 Test-Time Compute 是什么?

30 秒口述版

推理时通过更长思考、多样采样、搜索或验证器投入额外计算换取更高成功率。

原理与推导

收益取决于任务可验证性和候选多样性,成本、延迟与错误相关性会限制扩展。

公式、代码或工程案例

画 pass@k 随采样数的边际收益。

高频追问

  • Self-consistency 为什么有效?
  • 这个结论在规模、数据或硬件条件变化时,边界会怎样改变?

易错点

不要把输出更长直接等同于推理更强。

权威来源


后训练怎样防止能力回退?

30 秒口述版

混合通用数据、控制更新强度、加入 KL 或回放,并持续跑基座能力回归集。

原理与推导

能力回退可能来自数据窄化、格式过拟合和优化目标冲突,应按领域定位。

公式、代码或工程案例

每个 checkpoint 同时评估目标集与通用集。

高频追问

  • Model merging 能否修复回退?
  • 这个结论在规模、数据或硬件条件变化时,边界会怎样改变?

易错点

不要到训练结束才做一次回归。

权威来源