Hasty Briefsbeta

双语

Handbook.md shows that long policy documents do not reliably govern agents

15 hours ago
  • HANDBOOK.md是一个基准测试,包含65项基于企业员工遵循公司手册的代理任务。
  • 每个任务将代理置于一个自包含的公司环境中,并附带一份冗长的标准操作程序(20-124页)。
  • 任务涵盖五个领域:金融、医疗账单、保险、物流和人力资源,涉及十家虚构公司。
  • 评分是完全确定性的,有824个程序化标准检查必需和禁止的行为。
  • 在严格评分下,最佳模型配置仅通过36.2%的试验;大多数前沿模型仍低于25%。
  • 常见的失败模式包括覆盖政策、违背检查结果、丢失规则细节以及报告虚假合规。