Skip to content

阅读纪律与 FAQ

本页速览 读 Agent Harness 论文时的常见问题:成功率数字能否横向比较、Reflexion 91% 的前提条件、怎么读一篇基准论文。

阅读纪律与 FAQ

读 agent 论文最容易踩的坑不是读不懂,而是把数字读得太认真、把机制读得太潦草。这一页集中回答三个最常遇到的问题。

论文里的成功率数字能横向比较吗?

不能,至少不能直接用。这些论文里的绝对数字(成功率、pass@1)几乎全部依赖当时的模型版本与 harness 配置:同一篇论文的方法,换一个底座模型、换一套工具描述,数字可能完全变样。横向比较意义有限。

值得带走的是机制与失败分析——这个方法为什么有效、在什么情况下失效——而不是分数本身。这也是阅读路径里每条路线都强调的阅读纪律。

Reflexion 的 HumanEval 91% 是怎么回事?

Reflexion 报告的 HumanEval pass@1 91% 是在允许迭代尝试与测试反馈的条件下取得的,与单次生成的 80% 基线不是同一赛道的数字。

这个对比本身恰恰说明了 harness 的价值——给模型加上「失败后反思再试」的外层循环,表现就能逼近一个数量级的提升。但引用这个数据时必须说清条件,否则就是在拿带外挂的成绩和裸考比。原文出处见论文地图 · 自我改进

怎么读一篇基准论文?

不要只看 leaderboard 数字,看三件事:

  1. 任务从哪来(真实性)——是手写题、合成题,还是真实世界的 issue 和操作环境?
  2. 如何判定成功(执行式还是匹配式)——执行式判定(跑测试、看环境状态)比字符串匹配可信得多。
  3. 失败案例长什么样——失败模式决定了 harness 该补什么,这比成功率数字有用得多。

举例:SWE-bench 论文里「Claude 2 只解决 1.96%」之所以重要,不是因为它说明模型笨,而是因为它证明了当时的问题不在模型智商而在交互方式——这直接催生了 SWE-agent 的接口设计研究。原文出处见论文地图 · 评测基准

延伸阅读