Expedia Group 推出了 Service Telemetry Analyzer( STAR ),这是一个内部 AI 辅助可观测性平台,帮助工程师通过分析服务遥测数据并生成结构化根因评估,来调查生产环境中的故障事件。
该系统通过预定义的诊断工作流,将运营指标与大语言模型(LLM)结合起来,从而减少工程师识别服务性能下降根源所需的时间,同时确保人类仍然负责验证和决策。
该平台并没有采用自主 AI Agent,而是遵循一种确定性的工作流:先收集遥测数据,再使用领域专属提示词进行分析,将分析结果汇总为中间发现,最终生成包含潜在根因和建议后续步骤的报告。
在描述项目目标时,团队写道: 我们的目标是通过这项服务,将了解问题所需时间(TTK)和恢复时间(TTR)降至最低。
STAR 架构 该平台以 FastAPI 应用的形式实现,集成了 Datadog 用于获取服务指标,同时接入内部生成式 AI 网关,用于管理身份认证以及对 LLM 服务商的访问。
该工作流采用提示词链(prompt chaining),允许在生成汇总诊断结果之前执行多个专门化分析。
Expedia 表示,当前实现并未使用函数调用(function calling)、检索增强生成(RAG)、记忆能力(memory)或自主工具调用等能力,而是依靠预定义工作流来生成一致的分析结果。
STAR 主要关注从基于 Kubernetes 的服务和 JVM 应用中收集的标准化基础设施遥测数据。
该系统分析的指标包括请求吞吐量、延迟、HTTP、gRPC 和 GraphQL 错误率、CPU 和内存使用情况、容器重启事件、Kubernetes 就绪探针和存活探针失败情况、Java 堆内存使用率,以及垃圾回收活动。
Expedia 解释称,基础设施指标能够为使用不同编程语言和框架开发的服务提供统一视角。
随着平台不断演进,Expedia 用基于
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜