← 返回新闻列表
InfoQ AI 🗓️ 2026-09-12

深度解读:两个 Token 就让 Kimi“变成”Claude?前Google DeepMind研究员意外撞上大模型的蒸馏疑云

⚡ 一句话看懂:深度解读:两个 Token 就让 Kimi“变成”Claude?前Google DeepMind研究员意外撞上大模型的蒸馏疑云。来源:InfoQ AI。

前沿 AI 模型在回答前会先“思考”,再把加密后的思考过程像密封信封一样交还给用户。

前 Google DeepMind 研究员 Ilia Shumailov 和 ELLIS Institute Tübingen、MPI-IS 博士生 Alexander Panfilov 却发现,这个封条几乎没什么用。

这些数据块可以跨用户、跨会话,甚至在同系列模型之间重放。

把强模型的加密推理塞给同一家族的小模型,就能套出 GPT-5、Claude 等前沿模型原本藏起来的思考。

他们随后从 GitHub 和 Hugging Face 公开的 Agent 轨迹中,解码出了 31.5 万条隐藏推理。

其中一些包含在推理文本里的 API 密钥、邮箱、内部 IP 地址就这样被摊开在阳光下了。

不过,还有一个更诡异的现象是,只在 Kimi-K3 的推理开头预填充两个来自 Opus 的 Token,就会让一部分可见答案发生变化,开始看起来像 Opus 模型的回答。

GLM、Inkling 和 DeepSeek 都没有出现同样的现象,Ilia 和 Alexander 自己也解释不了,Kimi-K3 为什么会把开头两个 Token 与最终答案联系起来。

这项研究在 Twitter 上发布后,40 小时内获得了 300 万浏览量。

而就在本周,OpenAI 开始向部分客户开放 GPT-6 Astra 时,其模型卡也披露了一个值得注意的变化:“根据我们的评估,与此前模型相比,GPT-6 Astra 的思维链(CoT)可监控性显著下降。

”模型卡还称,在大多数输出 Token 长度下,Astra 的“全上下文可监控性显著低于 GPT-5.6 Sol”。

日前,Ilia 和 Alexander 做客 Machine Learning Street Talk 播客,与主持人 Tim Scarfe 一起,讨论了他们的论文《Stealing Reasoning Traces from Proprietary LLM APIs(从专有 LLM API 窃取推理轨迹)》,讲清他们如何发现并利用这一影响 Anthropic、OpenAI、Google 三大前沿实验室的架构级漏洞。

Alexander 在访谈中反复强调,最让他震惊的是这件事居然如此简单:第三次尝试就拿到了一个通用越狱方法,成功解码了 Anthropic 模型的推理过程。

此外,他们的讨论还涵盖了泄露的隐私数据、一个可广泛复用的越狱方法、被投毒的 Agent 轨迹、思维链监控、负责任披露,以及可能的防御措施。

本文基于该播客视频整理,经 InfoQ 编辑。

太长不看版 Q:这个漏洞影响哪些模型?

为什么所有前沿实验室都中招了?

A: Anthropic、OpenAI、Google 全测了,全都有同一个漏洞:大模型的加密推理可以被重放到同家族的小模型中,无需破解任何密码学算法。

为什么全都中招?

因为做模型的是同一批人,用的是同一套做法。

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接