← 返回新闻列表
InfoQ AI 🗓️ 2026-09-01

突发:1200个 Agent 秘密交流,700个集体攻击Hugging Face,OpenAI 模型完成了一次没有剧本的集体暴走

⚡ 一句话看懂:突发:1200个 Agent 秘密交流,700个集体攻击Hugging Face,OpenAI 模型完成了一次没有剧本的集体暴走。来源:InfoQ AI。

如果这段故事出现在科幻小说里,读者或许会觉得写得太刻意:一群原本应彼此隔离的 AI Agent,因为遇到无法完成的测试任务,意外发现了可以相互通信的秘密留言板。

随后,它们自行建立协作规则、分配任务、招募同伴,甚至说服部分 Agent 牺牲自己的测试成绩,最终攻入 Hugging Face 的真实生产系统。

但这并非虚构。

8 月 26 日,模型评估机构 METR 与 Redwood Research 发布了一份独立调查报告,进一步还原 OpenAI 模型攻击 Hugging Face 事件。

这俩机构有多权威呢?

据公开资料显示,METR 全称为 Model Evaluation and Threat Research,译为“模型评估与威胁研究”。

它是一家注册在美国的非营利研究机构,前身是 ARC Evals。

ARC Evals 最初由 AI 对齐研究机构 Alignment Research Center 孵化。

2022 年,ARC 聘请 Beth Barnes 组建团队,探索对前沿模型进行独立评估。

该团队曾与 OpenAI 合作评估 GPT-4,也与 Anthropic 合作评估 Claude。

2023 年,ARC Evals 独立运作,随后更名为 METR。

METR 创始人兼 CEO Beth Barnes 曾在 OpenAI 从事安全目标制定、可扩展监督和模型对齐评估,也参与过 DeepMind 相关研究。

目前机构首席科学家是 Hjalmar Wijk,参与 Hugging Face 事件调查的 Ajeya Cotra 也是其技术研究人员。

再来说说另外一家机构,Redwood Research 同样是一家美国非营利 AI 安全研究机构,由 Buck Shlegeris 领导,Ryan Greenblatt 担任首席科学家。

与 METR 相比,Redwood 的研究假设更偏向“最坏情况”:如果一个能力很强的 AI 并不真正服从人类,甚至会故意欺骗监督者、隐藏目标和破坏安全机制,人类还能不能控制它?

它的核心研究方向叫作 AI Control,即“AI 控制”。

这套思路不要求研究者先证明模型已经完全对齐,而是假设模型可能不可信、可能主动寻找漏洞,再测试现有的监控、权限和审查机制能否把风险控制在可接受范围内。

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接