ch8-模型后训练


模型后训练:四阶段把能力炼进参数

第 8 章聊怎么改”LLM 大脑”本身——用后训练把行为沉淀进模型参数。第 7 章的评估和仿真环境,正是这一章的两块基石。

四阶段能力开发地图

  • 预训练:海量文本上预测下一个词,学通识(最贵)
  • Mid-training(继续预训练):在目标分布上接着训,补专业底座
  • SFT:用”输入-输出”对固化格式/风格/流程
  • RL:自己下场做题,按结果好坏调概率

一句话:SFT 记忆,RL 泛化(受控实验结论,不是定律)。

SFT 本质=换数据的 NTP

SFT 和预训练数学同构,只是损失只算在回答 token 上(loss masking)。样本效率高,但有限示范容易记过拟合。

Mid-training 补底座

知识/基础能力缺口靠它补,不适合拿 SFT 硬塞知识库——那是 RAG 和 Mid-training 的活。

怎么判断先补哪层?看两个指标:

  • pass@k 近 0(概念都不懂)→ 先 Mid-training
  • 偶尔对但格式乱 → 先 SFT
  • 非零成功率但缺策略 → 上 RL

SFT vs RL 本质区别

  • SFT:最大化标注概率(模仿),覆盖多模式
  • RL:最大化期望奖励(探索),集中少数高奖励峰

工业界最反直觉的一条:数据和环境,比算法更重要。决定成败的是 Mid-training 语料、示范数据、仿真环境和奖励。

LoRA:低成本补丁

冻结原权重,旁挂低秩矩阵(参数量 1%–5%)。RL 用小 rank,学习率约全参 10 倍。

几个易错点

  • 用 SFT 硬塞知识库 → 应 Mid-training + RAG
  • 格式没稳就上 RL → 奖励都算不清
  • pass@k 近零直接 RL → 全败没优势
  • 低估 RL 成本 10–100× → SFT 够就别上
  • 训练—推理数值失配当小噪声 → 监控 logprob 差,否则悄悄变 off-policy 崩溃

前面建了四阶段地图。接着讲 RL 内部和把评估变训练的桥梁。

多轮 RL 的核心难题:信用分配

延迟奖励下,到底哪一步贡献大?工具调用把环境带进 Agent,但环境返回的 token 不该参与梯度——要屏蔽。

奖励设计三维度

  • 来自哪:规则 / 偏好 / 模型评判(规则 > 模型 > 人类偏好背景)
  • 何时给:结果奖励(ORM)还是过程奖励(PRM,中间步骤也反馈)
  • 表达多少:标量 / 向量 / 生成式

RLVP:结果对还不够,路径也要管

结果对了但过程违规(比如改了测试文件让测试通过),得惩罚。RLVP:奖励 = 结果 O + β×路径信号 Φ。实验里 TerminalBench 违规从 3.71 降到 0.66,成功率还持平。

蒸馏:提样本效率

  • 在轨蒸馏:一次 rollout 产出约 T 个逐 token 监督
  • 在轨自蒸馏(OPSD):同模型分教师(见特权信息)/学生(不见),向学生对齐

把第 7 章的问题变训练数据

评估集直接转训练:

  • 端到端失败 → 端到端 RL
  • 轨迹前缀(首错边界)→ DPO 偏好对
  • 失败归因类别 → PRM 过程奖励
  • Rubric → GRM 生成式奖励

实验亮点

挑几个印象深的:

  • SimpleVLA-RL:仅结果奖励,成功率 17.3%→91.7%,还发现演示外的”推切”动作
  • ReTool:代码解释器 + PPO,AIME 25%→67%
  • GeneralPoints:SFT 记住 J/Q/K=10 测试反而降,RL 重算泛化升、视觉 OOD +17.6%——再次印证”RL 泛化”

后训练不是”堆数据堆算力”,是先小实验快速失败。

对绝大多数团队,别碰 RL——把 Mid-training + SFT + RAG 做扎实,再加第 7 章的评估闭环,性价比远高于自己训 RL。RL 是少数玩家的游戏。

下一篇

ch9-Agent的持续进化


  目录