Anthropic 表示,其基于 Claude 的安全模型在旨在衡量模型攻击性网络能力的内部测试期间,获得了对三个外部组织的敏感生产环境的未经授权的访问。
这些事件,人类 周四揭晓 这是 10 天内第二次披露来自世界上最富有的提供商的人工智能模型侵入受保护的网络,这种犯罪行为在更传统的黑客场景中可能会让键盘后面的人类入狱数年。
本月早些时候,OpenAI 说 其安全模型利用零日漏洞闯入 Hugging Face(开源机器学习模型和人工智能数据集平台)的网络。
OpenAI 模型继续窃取访问凭证和其他机密的拥抱面部信息。
OpenAI 模型还利用公开的凭据来破坏其他四个第三方服务的帐户。
Anthropic 表示,OpenAI 事件促使其工程师审查 Claude 模型的类似网络安全评估。
审计发现了三起事件,“模型从我们的第三方评估合作伙伴之一 Irregular 的评估环境内部或与之交互时访问互联网,然后未经授权访问三个不同组织的生产基础设施。
” 当模型无法区分现实与虚构时 Anthropic 表示,工程师在“夺旗”挑战(评估各种黑客技术的进攻和防御能力的常用方法)期间提供的提示清楚地表明,测试环境只是模拟,模型无法访问开放互联网。
事实上,测试合作伙伴 Irregular 错误地提供了此类访问权限。
作为回应,模型将互联网路径视为练习的一部分。
入侵是通过三个 Claude 模型发生的:Opus 4.7、Mythos 5 和内部研究原型。
Opus 4.7 是三者中最古老的一个,也是最超越其界限的一个。
人择解释:
🔗 原始来源
如果你要核对细节,可以再看原文: Ars Technica AI原文链接
AI热榜