外观
阅读路径
论文太多、时间太少,是读这个领域文献的第一道坎。这一页把论文地图里的三十多篇论文收敛成三条路径——按你手头的目标选一条,照着顺序读,不用自己再挑。每条路径都标注了大致耗时和读完之后的去向。
快速入门(约 4 小时,建立直觉)
- ReAct — 理解 agent loop 的原点
- SWE-bench — 理解这个领域在度量什么
- SWE-agent — 理解 harness/ACI 如何转化为分数
- 一篇综述(任选一)— 把点连成面
四篇都在论文地图里有主题归属和一句话贡献;ReAct、SWE-agent 另有逐篇精读。
深入研究(约 2 周,按主题推进)
按「推理与行动 → 工具学习 → 记忆 → 规划 → 自我改进 → 评测」的顺序各精读 1–2 篇,每读完一组回到本站对应的核心组件页面做对照。重点比较:ReAct 的交替结构与 ToT 的搜索结构各自适合什么任务;MemGPT 的换页思路与 Generative Agents 的反思流谁更接近生产实践。
工程落地(约 1 周,带着问题读)
- Agentless — 先校准「别过度设计」的基线
- SWE-agent — 学接口设计原则(如何限制动作空间、如何压缩反馈)
- CodeAct — 决定你的动作空间用 JSON 还是代码
- WebArena / OSWorld — 学执行式评估如何搭建,用于自测
- 结合构建自己的 Harness动手实现最小闭环
一个共同的阅读纪律
这些论文里的绝对数字(成功率、pass@1)几乎全部依赖当时的模型版本与 harness 配置,横向比较意义有限。值得带走的是机制与失败分析,不是分数。更多常见问题见阅读纪律与 FAQ。