READING GUIDE
Agent 评测与迭代
评测回答系统在指定任务上做得怎样,执行轨迹记录一次运行中发生了什么;两者结合,才能支持定位问题和验证改动。以下先建立成功标准,再学习从开发、测试及线上运行中取证,最后阅读自动改进研究,区分提出修改与证明改进。
先定义任务成功,再设计评分
从评测文章中的任务、单次试验、评分器、执行轨迹与实际结果开始。Agent 声称完成任务,不代表环境已达到目标状态;重复运行也可能产生不同结果。再结合 Agent 工程的迭代视角,思考哪些检查能自动执行、哪些需要人工判断,以及评测是否覆盖了真正关心的行为。
- 详解 AI Agent 评测Anthropic
- Agent 工程:一门新学科LangChain
把执行轨迹转成可验证的改进
轨迹可以来自开发、测试或线上运行,它首先是行为记录,并不会自动成为评测结论。先理解轨迹与代码提供的不同证据,再沿改进循环学习如何补充反馈、归纳失败模式和构建回归用例。编程 Agent 的案例则提醒读者,问题也可能出在父子 Agent 交接的信息中。
- 传统软件由代码描述,而 Agent 由执行轨迹描述LangChain
- 基于执行轨迹数据才能建立 Agent 迭代机制LangChain
- 编程 Agent 是黑箱:如何看清它们的内部运行过程LangChain
用验证约束自动改进
先看 Cursor 如何结合离线评测与真实使用信号检验运行框架改动,再阅读自我改进综述,关注修改空间、验证器、留出测试和奖励投机。自动生成修改与确认改进是不同环节。AutoHarness 在本馆仅收录摘要,可用于了解研究问题,不能据此核对完整实验设置。
- 持续改进我们的 Agent 运行框架Cursor
- 面向自我改进的运行框架工程Lilian Weng
- AutoHarness:通过自动合成代码运行框架改进 LLM Agent(论文摘要)arXiv
本专题全部资料与文章
- 详解 AI Agent 评测Anthropic
- 传统软件由代码描述,而 Agent 由执行轨迹描述LangChain
- 基于执行轨迹数据才能建立 Agent 迭代机制LangChain
- 用并行运行的 Claude 团队构建 C 编译器Anthropic
- 编程 Agent 是黑箱:如何看清它们的内部运行过程LangChain
- AutoHarness:通过自动合成代码运行框架改进 LLM Agent(论文摘要)arXiv
- 面向自我改进的运行框架工程Lilian Weng
- Claude 3.5 Sonnet:刷新 SWE-bench Verified 成绩Anthropic