← 返回新闻列表
InfoQ AI 🗓️ 2026-09-13

最新动态:Read, Don't Write: 重塑大模型评价体系,构建全自动、可进化的“探测式”评测管线|QCon上海

⚡ 一句话看懂:最新动态:Read, Don't Write: 重塑大模型评价体系,构建全自动、可进化的“探测式”评测管线|QCon上海。来源:InfoQ AI。

从「构建 AI」到「驾驭 AI」,100+ 实战案例拆解 AI Native 时代的工程新实践!

推理模型持续突破能力边界,Coding Agent 深度参与研发流程,Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型,演变为能够自主规划、调用工具、执行任务的软件系统。

AI 不再只是软件中的一个能力,而开始成为软件系统的一部分。

这意味着软件工程面对的挑战也发生了变化:团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt,而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。

模型决定 AI 能做什么,系统决定 AI 能否真正创造价值。

在这一背景下,2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。

本次大会将于 10 月 22 日—24 日举办,聚焦 Harness AI 时代的工程实践,围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向,邀请全球技术社区与产业一线的实践者,系统性分享前沿洞察与实战经验,共同探索 AI 从能力到系统、从实验到生产的真实路径。

阿里巴巴高级技术专家孙鹏已确认出席 “AI Agent 可观测与持续改进工程” 专题,并发表题为《Read, Don’t Write: 重塑大模型评价体系,构建全自动、可进化的“探测式”评测管线》的主题分享。

当全行业都在为“如何让 LLM 评价得更准”而绞尽脑汁时,我们是否走错了路?

传统的生成式 LLM-as-a-Judge 正在成为企业沉重的“算力枷锁”:不仅全量评测成本高昂,更深陷字数偏置、中心化趋向等系统性偏置。

本次分享将带来一种全新的“探测式评测”范式——BoRP(Bootstrapped Regression Probing)。

他们不再让模型“写”评语,而是直接“读取”模型隐状态下的满意度信号。

通过对比表示提取与 PLS 回归技术,他们将评测成本降低了 97%,同时在人类对齐度上超越了传统的生成式 Judge。

他们将深入解析如何从零构建这套“读脑”管线,包括如何在无标注流量中自动孵化评测标准,以及如何通过层间不确定性量化评测的可信度。

这一方案已在万亿级流量的 A/B 测试中落地,为模型迭代提供了实时、高敏的“体温计”。

本次分享将结合真实案例,展示 badcase 如何入池、分派、修复和验证,并说明当前哪些环节仍需人工决策。

孙鹏,阿里巴巴高级技术专家。

目前从事千问智能体开发生态相关研发工作,此前主要负责信息流推荐业务架构、abtest 实验、交易系统等相关工作。

他在本次会议的详细演讲内容如下: 演讲提纲: 行业趋势与评测困境 开放式对话评测的现状:指标 Gap 与滞后的用户反馈。

传统生成式 Judge 的三大“税”:成本税、延迟税、偏置税(中心化倾向、字数偏置)。

BoRP 技术架构:从“读”取代“写”

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接