Orca-Bench: How Ready Are Language Model Agents for Oncall?
4 hours ago
- 大型语言模型(LLM)在编写、修补和搜索代码方面表现出色,但值班根本原因分析(RCA)需要从模糊的用户报告中推理嘈杂的指标、日志、跟踪和源代码,通常是在事件发生数小时后。
- ORCA-bench 是一个基准测试,它将通用编码代理置于生产保真度的值班环境中,使用一个实时的、由 OpenTelemetry 检测的微服务系统,该系统具有真实的遥测接口(通过 Grafana 访问 Prometheus、Jaeger、OpenSearch)和完整的源代码访问权限。
- 该基准测试包含1,079个RCA任务,系统地改变报告特异性、检测时间和共现故障场景,其真实症状由专家SRE策划并签字确认。
- 一个LLM作为评判者由人类独立重新评分(Cohen's κ_w = 0.90),在五个前沿代理中,最佳RCA准确率在中难度(真实输入)任务上为25.3%,在困难任务上为10.0%,即使使用像Claude Fable 5这样的先进模型也是如此。
- 最弱的模型在40%的事件报告中幻觉出一个不可信的根本原因,并且移除源代码访问会降低所有指标,凸显了LLM代理在生产可靠性方面的挑战。
- 这些结果是在一个精心策划的50 GB/六天测试台上,对公共系统上的隔离任务得出的;实际生产系统要大几个数量级且动态性更强,因此报告的性能差距是在前沿编码代理能够安全用于生产可靠性之前所需工程投资的下限。