Hasty Briefsbeta

双语

Benchmarking retrieval for agents on messy real-world company knowledge

7 hours ago
  • 公共检索基准在公司知识方面表现不佳,因为它们没有覆盖文档、Slack、工单和各种智能体查询等实际用例。
  • 公司知识基准是一个自定义基准,由1000个真实生产查询构建,每个评估案例包含一个查询、语料库快照和一个检索标准。
  • 检索质量由完整性、最小性和来源偏好定义,它倾向于权威和最新的来源,而不是较弱的来源。
  • 为了扩展基准创建,智能体在通过170个完全人工标注的评估案例验证后生成标签,确保与人类判断的高度一致性。
  • 固定流水线结果表明,添加重排序器是最划算的重大改进,将分数从0.41提高到0.50,且延迟成本很小。
  • 查询分解将分数提高到0.56,但延迟翻倍以上,并增加了模型调用成本。
  • 一个优化的固定流水线(Kapa Default)在3.3秒内得分为0.61,仅用五分之一的时间就达到了前沿模型grep智能体的水平。
  • 智能体检索器表明智能很重要:较大的推理模型得分为0.61,而较小的为0.54,但延迟和令牌成本较高。
  • Kapa Deep是一个优化的智能体检索器,在大约5秒内实现了最高得分0.65,精度最佳且每个查询的令牌使用量最低。
  • 该基准是私有的,因为它基于真实生产数据构建,团队计划继续提高准确性、延迟和成本。