← 返回新闻列表
InfoQ AI 🗓️ 2026-09-15

深度解读:从 Trace 到规模化实时评估:面向生产流量的 Agent 可观测实践|QCon上海

⚡ 一句话看懂:深度解读:从 Trace 到规模化实时评估:面向生产流量的 Agent 可观测实践|QCon上海。来源:InfoQ AI。

从「构建 AI」到「驾驭 AI」,100+ 实战案例拆解 AI Native 时代的工程新实践!

推理模型持续突破能力边界,Coding Agent 深度参与研发流程,Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型,演变为能够自主规划、调用工具、执行任务的软件系统。

AI 不再只是软件中的一个能力,而开始成为软件系统的一部分。

这意味着软件工程面对的挑战也发生了变化:团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt,而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。

模型决定 AI 能做什么,系统决定 AI 能否真正创造价值。

在这一背景下,2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。

本次大会将于 10 月 22 日—24 日举办,聚焦 Harness AI 时代的工程实践,围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向,邀请全球技术社区与产业一线的实践者,系统性分享前沿洞察与实战经验,共同探索 AI 从能力到系统、从实验到生产的真实路径。

蚂蚁集团架构师刘杨已确认出席 “AI Agent 可观测与持续改进工程” 专题,并发表题为《从 Trace 到规模化实时评估:面向生产流量的 Agent 可观测实践》的主题分享。

随着 Agent 进入真实业务场景,传统日志、指标和链路追踪已经难以完整回答 Agent 是否正确完成任务、问题发生在哪个环节,以及如何持续衡量和改善 Agent 质量。

本次分享将介绍建设企业级 Agent 可观测与评估体系的实践。

在采集层遵循 OpenTelemetry GenAI 语义约定,统一模型调用、工具调用和 Agent 执行过程的埋点与采集。

在评估层以 Trace 为核心,配置化接入诊断任务,通过实时处理管线完成任务筛选、关键信息提取和自动评估,到达分钟级延迟。

通过声明式表达式支持不同业务 Agent 低成本接入。

先小模型粗筛,再大模型精筛的两阶段评估机制,可有效降低 90% token 成本,使大规模安全、合规等底线类指标评估覆盖全生产流量成为可能。

针对部分复杂性能与质量类问题,还将介绍从 Agent 执行链路深入至推理引擎内部推理过程的探索。

刘杨,蚂蚁集团架构师,当前任职蚂蚁可观测技术架构师,参与或负责了产品/告警/计算/元数据等在内的可观测全技术栈建设,对于大型大规模分布式计算系统有丰富的性能优化经验。

最近两三年主要重心在大模型领域,包括推理引擎、Agent 可观测等。

他在本次会议的详细演讲内容如下: 演讲提纲: Agent 可观测面临的新问题 为什么拥有日志、指标和完整 Trace,仍然难以判断 Agent 是否正确完成任务并定位质量问题。

遵循 GenAI 语义约定的统一埋点与采集 如何统一模型调用、工具调用和 Agent 执行过程的遥测语义,并在标准字段基础上支持业务场景扩展。

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接