Unlocking parallel test-time scaling for long-horizon agents
a day ago
- 在长程编码代理中,重复历史为计算重用创造了机会,但并行代理会争夺内存,影响吞吐量。
- 在包含64个代理和731个SWE-bench Pro问题的基准测试中,Doubleword推理堆栈在20小时23分钟内完成了全部46,784次尝试,优于平均每个代理在24小时内处理10.7和24.8个问题的SGLang部署。
- Doubleword实现了比面向吞吐量优化的SGLang高30倍的请求和令牌速率,主要得益于亲和性路由和主机内存中的KV缓存保留,实现了98.1%的前缀缓存重用(对比2.16%)。
- 更高的吞吐量使每个问题可进行64次尝试,将解决成功率从51.2%(单代理)提升至70.7%(64个代理中的任意一个),提高了19.5个百分点。
- 使用Doubleword时每次尝试成本为0.049美元,远低于3.92美元(SGLang基线)和1.70美元(吞吐量优化SGLang),使重复采样在经济上可行。
- 使用DeepSeek-V4-Pro对每个问题进行64次尝试,在相似推理成本下达到或超越了专有模型(Gemini 3.1、GPT-5.6、Claude Opus 4.8),展示了并行测试时扩展在代理中的潜力。