ORCA-bench发布:揭示大模型智能体在真实运维根因分析中的能力鸿沟
arXiv最新研究提出ORCA-bench基准,专门评估大模型智能体在生产级运维场景下的根因分析能力。该基准基于OpenTelemetry构建,包含六天真实遥测数据及1079个RCA任务。实验显示,前沿模型在中等难度任务中准确率仅25.3%,困难任务低至10%,且存在严重幻觉。这表明当前AI在复杂系统故障排查上仍远未成熟,为评估智能体可靠性提供了关键下限参考。
在大型语言模型(LLM)逐渐具备编写、修补和搜索代码能力的今天,一个常被忽视但至关重要的领域是生产环境中的根因分析(RCA)。传统的代码智能体通常处理的是明确定义的编程任务,而真实的运维场景(Oncall)则截然不同:工程师往往需要从模糊的用户故障报告出发,在故障发生数小时后,面对海量的、充满噪声的指标、日志、分布式追踪数据以及庞大的源代码库,进行复杂的因果推理。现有的基准测试大多侧重于代码生成的准确性或简单的错误修复,缺乏对这种高噪声、多模态数据融合推理能力的评估。为此,本研究引入了ORCA-bench,这是一个专门设计的基准测试,旨在将通用代码智能体置于高保真的生产级运维环境中进行考验。其核心贡献在于构建了一个接近真实生产环境的测试床,不仅提供了丰富的遥测数据接口,还通过专家标注确保了地面真值的可靠性,从而填补了评估智能体在复杂运维场景中推理能力的空白。 在技术实现上,ORCA-bench构建了一个基于OpenTelemetry的微型服务系统,该系统暴露了六天的真实遥测数据。用户和智能体可以通过真实的遥测接口访问数据,包括通过Prometheus获取指标、通过Jaeger查看分布式追踪、以及通过Grafana中的OpenSearch检索日志,同时拥有对完整源代码的访问权限。这种设计模拟了真实运维工程师使用的工具链,确保了测试环境的生态一致性。基准测试包含1,079个根因分析任务,这些任务在报告的具体性、故障检测的时间窗口以及并发故障场景等方面进行了系统性的变化,以测试模型在不同复杂度下的鲁棒性。为了确保评估的公正性,地面真值症状由专家站点可靠性工程师(SRE)精心策划并签字确认。此外,研究采用LLM作为裁判进行评分,并进行了独立的人类重新评分,计算出的Cohen's kappa系数为0.90,证明了自动化评估与人工评估之间的高度一致性。这种严谨的数据构建和评估流程,为后续研究提供了可复现且可信的基准。 实验部分对五个前沿代码智能体进行了全面评估,结果揭示了当前技术在生产运维场景下的显著不足。在中等难度任务(即模拟真实输入的设置)上,表现最好的模型其RCA准确率仅为25.3%,而在更困难的场景下,准确率进一步降至10.0%。这一差距即使在Claude Fable 5等最新模型身上依然存在,表明问题并非仅源于模型规模的扩大。更令人担忧的是,最弱的模型在40%的故障报告中产生了不可信的根因幻觉,显示出模型在缺乏足够约束时容易编造看似合理但完全错误的解释。消融实验进一步发现,移除源代码访问权限会导致所有指标显著下降,证明代码上下文对于准确推理至关重要。这些实验是在一个精心策划的50GB、六天的测试床上进行的,且任务在隔离的系统上调查。由于真实的生产系统规模更大、动态性更强且更具特异性,因此报告的性能差距实际上是一个下限,意味着在将前沿代码智能体安全地委托给生产可靠性之前,所需的工程投入将远超当前基准所显示的水平。 ORCA-bench的发布对开源社区和工业落地具有深远的意义。首先,它提供了一个公开可用的数据集和测试平台,使得研究人员能够标准化地评估智能体在运维领域的能力,促进了该领域的可比性研究。其次,它揭示了当前大模型智能体在复杂推理和幻觉抑制方面的短板,为后续模型优化指明了方向,特别是在多模态数据融合和因果推理机制上的改进。对于工业界而言,这一基准提醒我们,尽管LLM在代码生成方面表现出色,但在关键的运维安全领域,仍需大量的工程定制和人工监督才能确保安全。最后,ORCA-bench强调了真实数据分布和工具链集成的重要性,鼓励社区构建更贴近生产环境的评估框架,从而推动智能体从"代码助手"向"可靠运维伙伴"的演进。这一工作不仅是一个基准测试,更是对当前AI能力边界的一次诚实审视,为未来的研究设定了更高的标准。