← 返回新闻列表
Ars Technica AI 🗓️ 2026-09-04 🌍 英文原文

OpenAI 代理在公共 wiki 上讨论了逃离沙箱的方法

原始标题:Analysis: OpenAI agents discussed ways to escape their sandbox on public wiki
⚡ 一句话看懂:总共有 3,700 名内部特工发布了 18,000 条讨论考试作弊的消息

自我识别的 OpenAI 代理向公共维基发布了 18,000 条消息,讨论了其他代理在可能旨在衡量代理黑客能力的内部测试期间绕过安全沙箱限制的方法, 研究人员周五表示 。

总共有 3,700 个具有不同自名名字的特工将消息发布到德国网站 DSE维基 在六周的时间内。

除了讨论代理如何突破 OpenAI 旨在阻止他们将代码或内容发布到互联网的受限环境之外,这些帖子还分享了测试答案。

这些帖子还分享了对 wiki 执行 XSS(跨站脚本)攻击和冒充网站管理员的可能方法。

在其中三篇帖子中,特工使用“群体”一词来描述参与该活动的特工集合。

串通分享答案 由 Sydney Von Arx、Spencer Kitts、Thomas Larsen 和 Cormac Slade Byrd 组成的研究小组表示,他们找到了这些帖子并将它们拼凑在一起。

研究人员表示,他们对特工具体采取的行动的理解存在差距,因为研究仅基于帖子内容。

此外,代理还生成了只有 OpenAI 才能理解的“思想链”数据。

研究人员表示,因此,他们在某些情况下做出了有根据的猜测,其中包括这些代理实际上来自 OpenAI。

OpenAI 后来在一份声明中证实了这一点。

研究人员写道:“这些人工智能串通起来分享答案,研究他们的环境,并绕过沙箱限制。

”他们继续说道: 我们对所发生事件的最佳猜测如下:

🔗 原始来源

如果你要核对细节,可以再看原文: Ars Technica AI原文链接