Agent的持续进化:让 Agent 从聪明变熟练
第 9 章处理一个”能力悖论”:Agent 能零样本解未见过的复杂任务,却可能处理一万次相似任务后还犯第一天的错。
模型部署后不会因一次推理自动改参数,上下文学习也只管当前任务。所以”持续进化”得建在模型外围——一套自主系统,区别于模型权重的”持续学习”。
核心闭环
记录运行证据 → 验证结果与过程 → 从轨迹提共性 → 决定更新知识/指令/程序/参数 → 待验证版本过回归和安全才发布。
关键一句:评价先于总结。无三层验证(结果/过程/质量),反思只是猜测。错误评价进长期知识会跨任务放大。
四种进化载体(按表示性质选)
- 经验知识库:最轻量,从轨迹提”什么条件怎样做”,非用户画像
- 指令 / Skill:多条相似轨迹暴露同一策略错且能语言描述,才提升为指令;最小 diff + 可回滚
- 程序 / Harness:稳定可验证操作编译成工作流;自改代码要隔离分支 + PR + 测试
- 模型参数:高维感知、自然语气、隐式策略难符号化,才用 SFT/RL(见第 8 章)
四种不互斥。比如医疗:参数识病灶 + 知识库指南 + 代码算风险。
(保存经历 ≠ 学习。日志写进向量库只是能找回案例,不自动跨案例归纳。)
三层验证结构
- 结果验证器(底层):真办成了没
- 过程验证器(中层):方式合规不
- 质量验证器(上层,LLM Rubric):办得合适不
(用户满意 ≠ 好。满意可能来自违规退款。要看规则遵从、隐私这些硬底线。)
前面讲了进化闭环和四种载体。接着讲怎么让它长期稳定跑。
双循环
- 在线执行循环:只记录证据,不轻易改自己
- 离线进化循环:空闲时聚合诊断、生成提案,过门槛才发布
Voyager(我的世界)三机制缺一不可:自动课程 + 技能库 + 迭代提示。
睡眠学习
类比”睡前整理记忆”:在线 Agent 跑完追加不可变证据,后台空闲期读新经历、比较合并、冲突解决、提提案、跑回归。不是真夜间跑,是离线整合防偶发改长期。
周期:触发→定向→采集整合→验证审批→修剪索引。需定期整理,否则上下文腐化、灾难性遗忘。
安全边界(三条)
- 证据与指令隔离:不可信证据不执行、不纳长期能力
- 待验证与正式能力隔离:先入待验证区,过检查才服务流量
- 安全机制不可自改:验证器/测试/门槛/日志/备份,业务 Agent 改不了
易错点集合
- 保存经历 = 学习(错,要主动评价归纳)
- Prompt 自动优化 = 自由重写(应是最小 diff + 可回滚)
- 程序化经验 = 重复点按钮(PreAct 须动作前/后/独立回放验证,假象”都点了但字段空”)
- 开放任务完成 = 进步(自动科研易实现漂移、过度乐观,需人定义问题与评价)
实验亮点
- τ²-bench 转接规则化:弱模型 telecom 反复重试转人工,归纳规则追加政策后通过率 12.3%→19.3%,旧任务无损
- PreAct:网页轨迹变工作流,加速 8.5–13 倍
- Hermes:无预设目标自己升级自己,但测试/批准权在外
持续进化这章把前面所有章串成闭环了:第 7 章评估出证据,第 8 章把证据变参数,第 9 章让系统自己转这个环。
中小团队最现实的第一步是”经验知识库 + 三层验证 + 最小 diff 回滚”——别一上来让 Agent 自改代码,先让它学会记笔记。