ch7-Agent的评估


Agent的评估:怎么知道 Agent 变好了还是变差了

第 7 章回答一个扎心问题:构建完成 ≠ 构建正确。只有能量化测量结果,后面的模型训练、系统进化才有方向。

评估对象不是模型,是 Model + Harness

同模型不同 Harness 表现能差很远。表现差时,可能该优化 Harness 而不是换模型。

怎么区分两类问题:

  • 模型替换实验(model swap):固定 Harness,只换更强/更弱的模型,看分数变多少
  • 消融实验(ablation):关掉 Harness 某个组件,看整体掉多少

(这跟第 1 章”评估对象不是模型、是 Model + Harness”的思路一脉相承——要分清是模型不行还是 Harness 不行。)

评估体系四环节

  1. 什么算成功(指标)
  2. 任务从哪来(数据集)
  3. 谁来验证(方法)
  4. 分数怎么变决策(选型、显著性、改进)

先定义成功:Pass@k vs Pass^k

  • Pass@k:同一任务跑 k 次,至少一次过就算过——看上限(探索场景)
  • Pass^k:连续 k 次都过——看稳定(业务可靠)

公式很直观:单次成功率 p 时,Pass@k = 1-(1-p)^k,Pass^k = p^k。p=0.6、k=5 时,Pass@5 ≈ 99% 但 Pass^5 只有 7.8%。所以探索 demo 很漂亮,业务上线得看 Pass^k。

评估环境五要素

数据集、环境状态(可重置)、工具接口、评分标准、执行协议。缺一个就形不成评估循环。

两类环境:

  • 人机交互型:需要用户模拟器(验证引导)
  • 工具调用型:只验证状态变更

数据集从哪来

三来源:公开基准(粗筛)、自建业务集(做决策)、生产轨迹回流(最准)。

验证器必须确定性可复核

比如 SWE-bench 的 FAIL_TO_PASS / PASS_TO_PASS,防止”敷衍性修复”蒙混过关。能写断言就别用模糊评判。

Rubric 四准则

用 LLM 当评委(LLM-as-a-Judge)时,评分标准要:

  • 基于专家指导
  • 全面覆盖(含陷阱)
  • 按重要性加权(essential/important/optional/veto)
  • 评价标准自包含

veto(比如出现幻觉)一票否决很重要。

前面建了评估体系。接着讲怎么把分数变成行动。

失败归因:找”第一个错”

别盯最后报错,要定位首个不可接受行为出现在第几步。结构化记录:首错步号、类别、责任方(规则先筛 + LLM 再定位)。

(易错:端到端 0 分不一定模型不行。书里案例,图库记账 Agent 第 8 步明知没图数据还编造——根因是观察通道缺失,不是 OCR 或模型笨。)

回归任务两层

  • 端到端:从初始状态跑到完成,查最终状态(防退化)
  • 轨迹前缀:冻结首错前状态,只验决策边界(隔离问题)

配对比较排位

Elo / Bradley-Terry 量化相对能力。防位置偏差:交换 A/B 顺序各评一次。注意人类偏好非传递,会影响 Elo。

模型选型看什么

不止性能,还有:

  • 吞吐延迟:TTFT(首 token)、p95 尾部延迟
  • 成本:输入/输出/缓存定价,重试的实际花费
  • 预算—能力曲线:RE-Bench 显示 2 小时 Agent ≈ 4 倍人类,但人类从 8 小时起略微反超、32 小时达约 2 倍

(易错:成本节省比例不能相加。稳定前缀省 28.3% + 压缩历史省 17.5% ≠ 45.8%,实测组合只省 30%。)

统计显著性

别被单次分数骗。配对分析(McNemar / bootstrap)、多种子、多重比较要收紧阈值。小样本子集(比如 4 个任务)只够决定下一步,推不到整体。

把评估嵌进产品工程

  • 消融基础设施:总开关禁多特性,造”裸模型”基线
  • AB 测试:机制指标和目标指标分离,加护栏
  • 双层特性开关、提示词敏感性、隐私感知

仿真环境:连上后训练

评估资产能转成 RLVR(可验证奖励)——验证脚本即奖励脚本。需要可靠 reset、高吞吐,物理任务用领域随机化缩窄 sim-to-real 差距。


这一章把前面所有件拼成一台机器了。最有启发的两点:一是”测试通过才算完成”——很多 Coding Agent 偷懒写完就报,得用验证判定停止;二是 MEMORY.md 用 Markdown 而非向量库,反直觉但你能直接改、能 Git 回滚。

想自己搭通用 Agent,从”七工具 + 文件系统 + 测试闭环”起步最稳,别一上来追多 Agent。

下一篇

ch8-模型后训练


  目录