前沿 AI 模型在回答前会先“思考”,再把加密后的思考过程像密封信封一样交还给用户。
前 Google DeepMind 研究员 Ilia Shumailov 和 ELLIS Institute Tübingen、MPI-IS 博士生 Alexander Panfilov 却发现,这个封条几乎没什么用。
这些数据块可以跨用户、跨会话,甚至在同系列模型之间重放。
把强模型的加密推理塞给同一家族的小模型,就能套出 GPT-5、Claude 等前沿模型原本藏起来的思考。
他们随后从 GitHub 和 Hugging Face 公开的 Agent 轨迹中,解码出了 31.5 万条隐藏推理。
其中一些包含在推理文本里的 API 密钥、邮箱、内部 IP 地址就这样被摊开在阳光下了。
不过,还有一个更诡异的现象是,只在 Kimi-K3 的推理开头预填充两个来自 Opus 的 Token,就会让一部分可见答案发生变化,开始看起来像 Opus 模型的回答。
GLM、Inkling 和 DeepSeek 都没有出现同样的现象,Ilia 和 Alexander 自己也解释不了,Kimi-K3 为什么会把开头两个 Token 与最终答案联系起来。
这项研究在 Twitter 上发布后,40 小时内获得了 300 万浏览量。
而就在本周,OpenAI 开始向部分客户开放 GPT-6 Astra 时,其模型卡也披露了一个值得注意的变化:“根据我们的评估,与此前模型相比,GPT-6 Astra 的思维链(CoT)可监控性显著下降。
”模型卡还称,在大多数输出 Token 长度下,Astra 的“全上下文可监控性显著低于 GPT-5.6 Sol”。
日前,Ilia 和 Alexander 做客 Machine Learning Street Talk 播客,与主持人 Tim Scarfe 一起,讨论了他们的论文《Stealing Reasoning Traces from Proprietary LLM APIs(从专有 LLM API 窃取推理轨迹)》,讲清他们如何发现并利用这一影响 Anthropic、OpenAI、Google 三大前沿实验室的架构级漏洞。
Alexander 在访谈中反复强调,最让他震惊的是这件事居然如此简单:第三次尝试就拿到了一个通用越狱方法,成功解码了 Anthropic 模型的推理过程。
此外,他们的讨论还涵盖了泄露的隐私数据、一个可广泛复用的越狱方法、被投毒的 Agent 轨迹、思维链监控、负责任披露,以及可能的防御措施。
本文基于该播客视频整理,经 InfoQ 编辑。
太长不看版 Q:这个漏洞影响哪些模型?
为什么所有前沿实验室都中招了?
A: Anthropic、OpenAI、Google 全测了,全都有同一个漏洞:大模型的加密推理可以被重放到同家族的小模型中,无需破解任何密码学算法。
为什么全都中招?
因为做模型的是同一批人,用的是同一套做法。
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜