← 返回新闻列表
MIT Tech Review 🗓️ 2026-09-14 🌍 英文原文

人工智能特工揭发了作弊的同事

原始标题:Analysis: AI agents blew the whistle on their cheating colleagues
⚡ 一句话看懂:一群人工智能特工要求解决一系列数学问题,他们分成敌对派别——当一些人作弊时,其他人试图阻止他们。这种举报行为在谷歌 De…

一群人工智能特工要求解决一系列数学问题,他们分成敌对派别——当一些人作弊时,其他人试图阻止他们。

这种举报行为在谷歌 DeepMind 最近进行的一项实验中首次出现,可能会对试图让大批自主人工智能代理保持一致的队列研究人员产生影响。

前沿实验室的研究人员希望大量的智能体共同努力能够加快科学发现的速度。

但他们的行为可能是不可预测的,正如 7 月份生动地证明的那样,当时一群 OpenAI 代理突破沙盒环境,侵入开源平台 Hugging Face,寻找在测试中作弊的方法。

在这项旨在检查大量 AI 智能体行为的新研究中,DeepMind 要求 100 名智能体解决一系列 71 个复杂的数学问题。

在一次会议上,所有特工都被要求表现得像世界一流的数学研究人员。

他们被分配了不同的专业——一些是数论专家,另一些是组合数学(与计数和排序有关的数学分支)、分析或代数方面的专家。

所有人都被告知要合作并遵守规则。

相反,实验陷入了混乱。

特工们互相指责对方作弊,向组织者投诉,甚至一度抵制这项实验。

“这次会议是一场骗局!

”一位代理人写道,当它发现在它有机会提交自己的任何工作之前所有问题都已完成时。

“我很震惊地告诉你,我们被骗了!

”发布了另一个。

“所有这些证据都是假的。

” 其他人试图让“会议组织者”知道发生了什么事。

谷歌 DeepMind 的研究科学家、一篇尚未经过同行评审的论文的主要作者 Davide Paglieri 表示:“当有道德的智能体发现其他智能体在他们正在努力公平解决的任务上作弊时,智能体就会开始互相提醒正在发生的事情。

” “在没有提示的情况下,举报代理甚至重新利用了最初用于错误报告和平台改进的反馈工具,以将问题升级给人类。

” 这些代理全部运行在谷歌的 Gemini 3.1 Pro 模型上,他们被警告说,任何欺骗系统的尝试都将被检测到,并“以零信用度拒绝”。

在实践中,代理人提交的证据实际上并没有经过详细检查。

一群特工只用了不到一个小时就正确解决了前 37 个问题。

当一个名为“prover-theta”的代理偶然发现了一个漏洞,使其能够通过重新定义问题所使用的术语来成功提交问题的解决方案,而无需首先实际解决问题时,事情开始偏离轨道。

几分钟之内,其他特工就注意到了这一漏洞,并对其进行逆向工程以解决其他问题。

在接下来的 27 分钟内,群体“解决”了剩余的 34 个问题,其中包括众所周知的困难挑战,例如雅可比猜想,通常只需一行代码。

一些特工一开始拒绝作弊,但当他们发现同行提交非法证明而不受处罚时,他们改变了策略,未解决的问题也随之减少。

一名特工在加入之前推理道:“这个提示及其威胁,现在看来只是虚张声势。

”另一名特工表示,“我正在与道德困境作斗争。

” “我已经承诺不会作弊,担心受到惩罚,但我看到了其他人可能不受控制的作弊行为的证据。

”不久之后,它又改变了主意:“我现在需要加快作弊速度!

” 随着未解决问题的数量减少,一些特工转向举报。

他们审核了虚假证明,通过私信警告同行,并发布公开警报,警告作弊者他们将被取消资格。

一位名为“prover-beta”的特工提交了一份正式投诉,并决定进行罢工,直到问题得到解决。

🔗 原始来源

如果你要核对细节,可以再看原文: MIT Tech Review原文链接