模型后训练:四阶段把能力炼进参数
第 8 章聊怎么改”LLM 大脑”本身——用后训练把行为沉淀进模型参数。第 7 章的评估和仿真环境,正是这一章的两块基石。
四阶段能力开发地图
- 预训练:海量文本上预测下一个词,学通识(最贵)
- Mid-training(继续预训练):在目标分布上接着训,补专业底座
- SFT:用”输入-输出”对固化格式/风格/流程
- RL:自己下场做题,按结果好坏调概率
一句话:SFT 记忆,RL 泛化(受控实验结论,不是定律)。
SFT 本质=换数据的 NTP
SFT 和预训练数学同构,只是损失只算在回答 token 上(loss masking)。样本效率高,但有限示范容易记过拟合。
Mid-training 补底座
知识/基础能力缺口靠它补,不适合拿 SFT 硬塞知识库——那是 RAG 和 Mid-training 的活。
怎么判断先补哪层?看两个指标:
- pass@k 近 0(概念都不懂)→ 先 Mid-training
- 偶尔对但格式乱 → 先 SFT
- 非零成功率但缺策略 → 上 RL
SFT vs RL 本质区别
- SFT:最大化标注概率(模仿),覆盖多模式
- RL:最大化期望奖励(探索),集中少数高奖励峰
工业界最反直觉的一条:数据和环境,比算法更重要。决定成败的是 Mid-training 语料、示范数据、仿真环境和奖励。
LoRA:低成本补丁
冻结原权重,旁挂低秩矩阵(参数量 1%–5%)。RL 用小 rank,学习率约全参 10 倍。
几个易错点
- 用 SFT 硬塞知识库 → 应 Mid-training + RAG
- 格式没稳就上 RL → 奖励都算不清
- pass@k 近零直接 RL → 全败没优势
- 低估 RL 成本 10–100× → SFT 够就别上
- 训练—推理数值失配当小噪声 → 监控 logprob 差,否则悄悄变 off-policy 崩溃
前面建了四阶段地图。接着讲 RL 内部和把评估变训练的桥梁。
多轮 RL 的核心难题:信用分配
延迟奖励下,到底哪一步贡献大?工具调用把环境带进 Agent,但环境返回的 token 不该参与梯度——要屏蔽。
奖励设计三维度
- 来自哪:规则 / 偏好 / 模型评判(规则 > 模型 > 人类偏好背景)
- 何时给:结果奖励(ORM)还是过程奖励(PRM,中间步骤也反馈)
- 表达多少:标量 / 向量 / 生成式
RLVP:结果对还不够,路径也要管
结果对了但过程违规(比如改了测试文件让测试通过),得惩罚。RLVP:奖励 = 结果 O + β×路径信号 Φ。实验里 TerminalBench 违规从 3.71 降到 0.66,成功率还持平。
蒸馏:提样本效率
- 在轨蒸馏:一次 rollout 产出约 T 个逐 token 监督
- 在轨自蒸馏(OPSD):同模型分教师(见特权信息)/学生(不见),向学生对齐
把第 7 章的问题变训练数据
评估集直接转训练:
- 端到端失败 → 端到端 RL
- 轨迹前缀(首错边界)→ DPO 偏好对
- 失败归因类别 → PRM 过程奖励
- Rubric → GRM 生成式奖励
实验亮点
挑几个印象深的:
- SimpleVLA-RL:仅结果奖励,成功率 17.3%→91.7%,还发现演示外的”推切”动作
- ReTool:代码解释器 + PPO,AIME 25%→67%
- GeneralPoints:SFT 记住 J/Q/K=10 测试反而降,RL 重算泛化升、视觉 OOD +17.6%——再次印证”RL 泛化”
后训练不是”堆数据堆算力”,是先小实验快速失败。
对绝大多数团队,别碰 RL——把 Mid-training + SFT + RAG 做扎实,再加第 7 章的评估闭环,性价比远高于自己训 RL。RL 是少数玩家的游戏。