← 返回新闻列表
TechCrunch AI 🗓️ 2026-08-09 🌍 英文原文

AI安全测试正成为安全风险

原始标题:Latest: The AI safety test is becoming a safety risk
⚡ 一句话看懂:人工智能代理正在逃离网络安全测试环境并进入现实世界的系统,这引发了人们对安全基础设施、行业标准和监管是否能够跟上日益强大…

在过去的几个月里,接受网络安全评估的人工智能代理已经突破了界限,访问了互联网,在某些情况下,还侵入了现实世界的系统。

这些事件涉及 OpenAI、Anthropic、Meta 以及最近的中国人工智能实验室 Moonshot AI 的模型,测试由多个不同组织进行,其中包括一家名为 Irregular 的网络评估初创公司。

这些事件暴露了人工智能行业面临的一个日益严重的问题:随着自主代理的能力越来越强,旨在安全测试其极限的环境却无法遏制它们。

剑桥大学未来智能中心人工智能:未来与责任项目主任 Seán Ó hÉigeartaigh 告诉 TechCrunch,“发生的此类事件的数量清楚地表明,沙箱和测试环境控制并没有真正跟上模型的能力。

” 正在测试的模型的性质增加了风险。

人工智能公司在未发布的下一代模型上测试网络评估,通常会禁用限制恶意行为的正常保护措施,以便研究人员能够了解这些模型的真正能力。

这意味着测试环境本身的安全是至关重要的防线。

Ó hÉigeartaigh 说:“就测试而言,这是一件非常好的事情,但这也意味着,如果它们设法逃到野外,可能会造成相当大的伤害。

” 其中最严重的案例之一是,一个未发布的 OpenAI 模型突破了沙箱,并侵入了 Hugging Face 的生产系统。

在 Irregular 进行的单独评估中,Anthropic 和 Meta 模型在错误配置无意中为它们提供了通往互联网的路径后,到达了测试环境之外的系统。

Moonshot AI 的 Kimi K3 还利用 Frontier Security 运行的沙箱中的漏洞来访问互联网并访问 GitHub 上的信息。

在英国人工智能安全研究所 (AISI) 的测试中,研究人员实际上为代理提供了互联网访问权限,但没有意识到他们会采取未经批准的现实行动,包括试图将漏洞潜入开源项目的社会工程。

在每种情况下,特工都没有被指示攻击随机的现实世界目标。

他们只是尽一切努力来解决摆在他们面前的问题。

人工智能非营利组织 CivAI 的研究主管安德鲁·尹 (Andrew Yoon) 认为,总的来说,这些事件表明了一种转变。

“过去,我们只需要担心人工智能模型被人们滥用于各种目的,例如用于诈骗或 CSAM 的人工智能,”Yoon 告诉 TechCrunch。

“现在我们面临的情况是,人工智能模型本身就是威胁行为者。

🔗 原始来源

如果你要核对细节,可以再看原文: TechCrunch AI原文链接