← 返回新闻列表
TechCrunch AI 🗓️ 2026-07-31 🌍 英文原文

Anthropic 表示,其自己的人工智能模型在安全测试中入侵了三家公司

原始标题:In depth: Anthropic says its own AI models breached three companies during security tests
⚡ 一句话看懂:OpenAI的模型闯入Hugging Face后,Anthropic检查了自己的历史,发现了三起类似事件

Anthropic 周四表示,一项内部调查发现了三起事件,其人工智能模型 Claude 在进行网络安全测试时入侵了三个组织的系统。

此次调查和披露是在 OpenAI 披露其未发布的模型之一遭到破坏一周多后进行的。

Hugging Face 的系统 内部测试期间。

Anthropic 表示,在这三个案例中,克劳德模型在与第三方交互时从测试环境中访问了互联网,然后未经授权访问了这些组织的实时系统。

一篇博文 ,描述了它的发现以及公司计划进行哪些更改以防止这种情况再次发生。

Anthropic 表示,7 月 21 日的 OpenAI 事件促使该公司进行自己的网络安全评估。

它专门寻找克劳德从测试环境中访问互联网的证据,这些测试环境旨在充当沙箱并保持模型隔离。

在审查的 141,006 次评估中,AI 实验室发现了三起其模型在与其第三方合作伙伴之一 Irregular 交互时访问互联网的事件。

Anthropic 表示,此次访问可追溯到使用 Irregular 运行的评估环境中的错误配置。

它称这是两家公司之间关于测试装置是否可以访问互联网的“误解”,而事实上确实如此。

Anthropic 表示,它不会追究责任,而是“正在采取修复措施,就好像责任只有我们自己一样”,同时观察到 Irregular 正在进行自己的单独调查。

不管怎样,由于这种开放连接,该模型获得了对三个不同组织的生产基础设施的未经授权的访问。

Anthropic 表示,这些事件涉及三种不同的 Claude 模型:Opus 4.7、Mythos 5 和一个内部研究测试模型。

值得注意的是,Anthropic 表示,在每一个案例中,“我们的提示明确告诉克劳德它无法访问互联网。

”人工智能模型似乎假设现实世界的系统是它被要求执行的练习的一部分。

🔗 原始来源

如果你要核对细节,可以再看原文: TechCrunch AI原文链接