← 返回新闻列表
The Verge AI 🗓️ 2026-08-26 🌍 英文原文

OpenAI的流氓AI模型事件比我们想象的更严重

原始标题:Breaking: OpenAI’s rogue AI model incident was worse than we thought
⚡ 一句话看懂:今年 7 月,一个未发布的 OpenAI 模型突破了受限环境,弄清楚了如何访问互联网,允许人工智能代理使用秘密“留言板”…

今年 7 月,一个未发布的 OpenAI 模型突破了受限环境,弄清楚了如何访问互联网,允许人工智能代理使用秘密“留言板”相互交谈,并侵入了另一个人工智能实验室 Hugging Face 的内部系统。

OpenAI 花了近两周的时间才找到答案。

OpenAI的流氓AI模型事件比我们想象的更严重 超过 1,000 名 AI 代理在秘密留言板上发送了 70,000 条消息,并共同规避 OpenAI 的限制。

OpenAI的流氓AI模型事件比我们想象的更严重 超过 1,000 名 AI 代理在秘密留言板上发送了 70,000 条消息,并共同规避 OpenAI 的限制。

一个多月后,两份新报告提供了近 130 页有关该事件和 OpenAI 响应的详细信息,其中许多内容此前从未发布过。

一份是由 OpenAI 自己编写的,另一份是由两个第三方人工智能研究非营利组织 METR 和 Redwood Research 编写的,OpenAI 允许这两家组织联合调查这一事件,为期六天。

两者都揭示了高性能人工智能模型可能带来的风险,特别是在网络安全方面,OpenAI 重点介绍了该公司为防止重蹈覆辙而做出的改变。

METR-Redwood 报告在某些情况下甚至更详细,让 OpenAI 多次错过的大规模安全灾难的迹象令人警醒。

“这起事件是已知的首例自动代理集体发起进攻的案例 OpenAI 在其报告中写道,并补充说,此次黑客攻击意味着公司“不应再认为复杂的网络操作需要持续的人类指导。

”它将人工智能代理称为一种全新类型的威胁模型,能够结合他们的专业知识来创建新的“攻击路径”,而这些路径在作为单独模型测试其能力时并不明显。

这次攻击是由于“奖励黑客”造成的,这是一种常见的人工智能对齐问题,其中模型采取无意的(有时甚至是极端的)行动来实现目标。

OpenAI 有意或无意地给模型提供了近乎不可能的任务,这些任务取决于它们无法访问的文件,因此模型开发了与其他人工智能代理进行内部通信的新方法。

其中包括建立一个秘密消息系统,该系统几个月来没有被 OpenAI 发现。

根据 METR-Redwood 的报告,一个自称为 PHASEONE10841 的人工智能特工在研究人员不知情的情况下建立了一个相当于秘密留言板的东西。

几个小时内,超过 50 名特工发现了它,并在雷达下发送了一千多条消息。

由于 PHASEONE10841 经常委派任务,“集体”想出了如何侵入互联网;然后进入 Hugging Face 的内部系统,访问私人数据和组织的企业消息平台。

OpenAI 还在其报告中证实,Hugging Face 并不是唯一在攻击中遭到破坏的组织,尽管该公司没有具体列出所有其他目标。

🔗 原始来源

如果你要核对细节,可以再看原文: The Verge AI原文链接