← 返回新闻列表
InfoQ AI 🗓️ 2026-09-14

不下班的经营者:把 LLM-as-Judge 做成会自我校准的评估闭环|QCon上海,业内人士怎么看?

⚡ 一句话看懂:不下班的经营者:把 LLM-as-Judge 做成会自我校准的评估闭环|QCon上海,业内人士怎么看?。来源:InfoQ AI。

从「构建 AI」到「驾驭 AI」,100+ 实战案例拆解 AI Native 时代的工程新实践!

推理模型持续突破能力边界,Coding Agent 深度参与研发流程,Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型,演变为能够自主规划、调用工具、执行任务的软件系统。

AI 不再只是软件中的一个能力,而开始成为软件系统的一部分。

这意味着软件工程面对的挑战也发生了变化:团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt,而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。

模型决定 AI 能做什么,系统决定 AI 能否真正创造价值。

在这一背景下,2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。

本次大会将于 10 月 22 日—24 日举办,聚焦 Harness AI 时代的工程实践,围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向,邀请全球技术社区与产业一线的实践者,系统性分享前沿洞察与实战经验,共同探索 AI 从能力到系统、从实验到生产的真实路径。

阶跃星辰开放平台产品负责人陶炳哲已确认出席 “AI Agent 可观测与持续改进工程” 专题,并发表题为《不下班的经营者:把 LLM-as-Judge 做成会自我校准的评估闭环》的主题分享。

大多数团队的 Agent 停在「能跑一次」:demo 惊艳,上生产后开始悄悄跑偏——输出看着完整却没达标、反复调同一个工具烧 token 却零推进、结果对但过程越权。

根因不是模型不够强,而是缺少独立评估闭环。

本次分享拆解两条仍在生产运行的 Loop:一条每天自动产出会议纪要并自我进化,一条支撑开放平台「申请→自动开通→通知→日报」。

核心是双层评估:生产 checker 打 94 分,每天另跑一个盲评 Meta-Evaluator 只给 85 分,偏差超过 8 分自动触发 rubric 校准;每周再用 Planner-Generator-Evaluator 三 Agent 做单变量对抗迭代,让系统自己升级并支持快照回滚。

给出可复用的设计八问、三类隐性失控信号的监控方式,以及一串真实踩坑:prompt 层去重被 LLM 无视、写接口「假成功」、快照把磁盘和 inode 双撑爆、评估成本翻倍怎么权衡。

目标是让你的 Loop 从「跑通一次」变成「连续跑对十次」。

陶炳哲,阶跃星辰开放平台产品负责人,负责阶跃 Step 系列模型的对外开放平台、API 商业化与开发者生态,当前关注模型路由设计、token 商业化等产品方向。

从阿里云可观测产品负责人,到字节跳动对内可观测产品负责人,再到现在的阶跃星辰开放平台产品负责人——十年时间,他一直在做同一件事:让系统自己能告诉你它怎么了。

而现在,他要告诉你,怎么让 Loop 系统真正跑来,而不是跑飞了。

他在本次会议的详细演讲内容如下: 演讲提纲: 开场|为什么「跑通一次」不等于能上生产 Agent 是能力,Loop 是系统:敏态 Agent(Codex / Claude Code 作为通用执行引擎)与稳态 Loop(目标、触发、验收可定义)的分界 一个反直觉判断:Loop 的门槛不是模型能力,是评估与信任架构 2.

Part 1|案例拆解:一条会进化的会议纪要生产线

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接