可观测性工程师中有越来越多的人认为,大语言模型的推理能力已经不再是 AI 辅助根因分析的瓶颈。
当前更棘手的问题在于决定哪些数据能传入模型的处理流程。
对于将大语言模型应用于事件响应的团队而言,他们从实践中得出的一个启示是:投入精力准备上下文信息,其回报可能比追求更强大的模型更为可观。
大多数 AI 根因分析(RCA)工作可以分为两大类。
基于代理的设计会向模型提供工具,让其自行展开调查,并在推理过程中自主选择要获取哪些遥测数据。
确定性设计则会在前期就建立起信号间的关联,并向模型提供一个预先准备好的上下文。
Coroot 的工作反映出,业界普遍正朝着第二种范式转变: Dynatrace 的 Davis AI 也是依赖于确定性的、基于拓扑结构的因果分析,通过遍历实时依赖关系图来精准定位根本原因,而非让大语言模型(LLM)在开放式的代理循环中自由运行。
这两种方法的故障表现形式各不相同,这使得难以判断诊断失败是源于推理能力不足,还是源于向模型提供了错误证据的治理框架。
可观测性供应商 Coroot 的最新研究试图将这两个变量区分开来。
在其 原创研究 中,工程师 Nikolay Sivko 将借助大语言模型(LLM)进行根因分析(RCA)的过程拆分为两项任务:对当前呈现的数据进行推理,以及决定哪些数据以何种形式传入模型的“数据采集框架”。
他认为,“AI 能否进行根因分析?
”这个问题本身就是错误的,因为这两项任务需要分别进行评估。
Coroot 的处理流程将信号关联成调查结果,并在不涉及代理循环的情况下,以单一聚焦的上下文形式将这些结果传递给大模型,这样就可以将错误答案归因于模型本身,而非证据缺失。
为了验证这一机制,Sivko 构建了一个场景:通过 Chaos Mesh NetworkChaos
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜