DoGBench: The first user-facing docs generation benchmark. No model scores >50%
4 hours ago
- DoGBench是一个基准测试,用于评估那些使用真实仓库事件和报告缺口来编写和维护面向用户的软件文档的AI代理。
- 它包括来自开源项目的292个任务:205个需要文档修改,87个不需要修改,主要评估基于117个项目的保留集。
- 代理难以决定何时需要更新文档,既会过度更新,也会遗漏必要的修改。
- 评估系统中最高综合得分为47.3/100,由Qwen3.8 Max与OpenCode实现。
- 一项广泛审计发现,45.5%的提交存在任务完成缺口,36.6%存在技术不准确,32.5%遗漏了核心概念,6.1%包含虚构内容。
- 专家评审仍然必要;最高P0级清洁交付率为39.0%(GPT-5.6 Sol with Codex)。
- 评估使用任务特定评分标准,包含超过3000个标准,任何P0标准未通过都会将补丁的分数上限限制在60分(满分100分)。
- DoGBench分别报告更新决策(正确弃权)和补丁质量,使用调和平均数计算综合得分。