An Empirical Study of Harness Design for Coding Agents
4 hours ago
- 本研究逐组件评估编码框架,在保持执行循环不变的情况下,改变规划、行动空间和上下文管理。
- 在SWE-Bench Verified和Terminal-Bench 2.1上的四个模型中,测试了176个匹配设置,涵盖五种上下文管理策略、四种上下文窗口预算以及规划和行动空间的消融实验。
- 在更严格的上下文窗口预算下,上下文管理更有价值,主要是通过防止上下文溢出失败。
- 在基于LLM的摘要之前进行基于规则的省略是最有效的上下文管理策略;使省略的内容可恢复会增加复杂性而不会提高准确性。
- 规划对于较弱的模型起到准确性支撑的作用,但对于较强的模型则成为成本节约器,而准确性的变化最小。
- 预定义工具帮助bash熟练度较弱的模型,而具备bash能力的模型在仅使用bash的接口上表现良好,显著降低成本,尤其是在以命令行为中心的任务上。
- 轨迹分析显示:上下文管理延长轨迹而不会显著改变行为,规划改变轨迹停止的位置,行动空间影响代码编写的粒度。
- 研究结果为模型和预算感知的框架设计提供信息,并提出了一个模块化的评估框架,用于未来的框架组件。