资料馆/专题导读

READING GUIDE

Agent 评测与迭代

评测回答系统在指定任务上做得怎样,执行轨迹记录一次运行中发生了什么;两者结合,才能支持定位问题和验证改动。以下先建立成功标准,再学习从开发、测试及线上运行中取证,最后阅读自动改进研究,区分提出修改与证明改进。

资料馆编辑导读 · 更新

先定义任务成功,再设计评分

从评测文章中的任务、单次试验、评分器、执行轨迹与实际结果开始。Agent 声称完成任务,不代表环境已达到目标状态;重复运行也可能产生不同结果。再结合 Agent 工程的迭代视角,思考哪些检查能自动执行、哪些需要人工判断,以及评测是否覆盖了真正关心的行为。

把执行轨迹转成可验证的改进

轨迹可以来自开发、测试或线上运行,它首先是行为记录,并不会自动成为评测结论。先理解轨迹与代码提供的不同证据,再沿改进循环学习如何补充反馈、归纳失败模式和构建回归用例。编程 Agent 的案例则提醒读者,问题也可能出在父子 Agent 交接的信息中。

用验证约束自动改进

先看 Cursor 如何结合离线评测与真实使用信号检验运行框架改动,再阅读自我改进综述,关注修改空间、验证器、留出测试和奖励投机。自动生成修改与确认改进是不同环节。AutoHarness 在本馆仅收录摘要,可用于了解研究问题,不能据此核对完整实验设置。

本专题全部资料与文章