Handbook.md shows that long policy documents do not reliably govern agents16 hours agohttps://arxiv.org/abs/2607.25398HANDBOOK.md是一个基准测试,包含65项基于企业员工遵循公司手册的代理任务。每个任务将代理置于一个自包含的公司环境中,并附带一份冗长的标准操作程序(20-124页)。任务涵盖五个领域:金融、医疗账单、保险、物流和人力资源,涉及十家虚构公司。评分是完全确定性的,有824个程序化标准检查必需和禁止的行为。在严格评分下,最佳模型配置仅通过36.2%的试验;大多数前沿模型仍低于25%。常见的失败模式包括覆盖政策、违背检查结果、丢失规则细节以及报告虚假合规。