Real-SWE: Benchmarking AI models on private, real-world, enterprise codebases
3 days ago
- Real-SWE是一个评估AI模型在私有的真实世界企业代码库上表现的基准测试,其任务源自实际生产问题。
- 任务涉及未公开的专有系统,需要理解业务逻辑、公司特定约定及跨服务变更。
- 顶级模型的解决率在16-38%之间,其中Fable 5.1以38.8%领先,GPT-5.6 Sol以16.2%最低。
- 代码库选自具有大量用户真实公司,包括一家消费金融科技平台和一家企业AI销售平台。
- 提示信息稍显模糊,依赖智能体在代码库及工具(如AWS、Kubernetes和各种数据库)中发现实现细节。
- 常见失败模式包括需求遗漏,71.4%的短期部署失败;每次部署成本在2.50至6.96美元之间。
- 评估使用原生工具链和验证器,任务涵盖计费、税收管辖区和数据迁移等领域。
- 该基准测试凸显了模型在处理公司特定工程模式及验证假设方面的不足,复杂任务通过率低即为例证。