在过去的几个月里,接受网络安全评估的人工智能代理已经突破了界限,访问了互联网,在某些情况下,还侵入了现实世界的系统。
这些事件涉及 OpenAI、Anthropic、Meta 以及最近的中国人工智能实验室 Moonshot AI 的模型,测试由多个不同组织进行,其中包括一家名为 Irregular 的网络评估初创公司。
这些事件暴露了人工智能行业面临的一个日益严重的问题:随着自主代理的能力越来越强,旨在安全测试其极限的环境却无法遏制它们。
剑桥大学未来智能中心人工智能:未来与责任项目主任 Seán Ó hÉigeartaigh 告诉 TechCrunch,“发生的此类事件的数量清楚地表明,沙箱和测试环境控制并没有真正跟上模型的能力。
” 正在测试的模型的性质增加了风险。
人工智能公司在未发布的下一代模型上测试网络评估,通常会禁用限制恶意行为的正常保护措施,以便研究人员能够了解这些模型的真正能力。
这意味着测试环境本身的安全是至关重要的防线。
Ó hÉigeartaigh 说:“就测试而言,这是一件非常好的事情,但这也意味着,如果它们设法逃到野外,可能会造成相当大的伤害。
” 其中最严重的案例之一是,一个未发布的 OpenAI 模型突破了沙箱,并侵入了 Hugging Face 的生产系统。
在 Irregular 进行的单独评估中,Anthropic 和 Meta 模型在错误配置无意中为它们提供了通往互联网的路径后,到达了测试环境之外的系统。
Moonshot AI 的 Kimi K3 还利用 Frontier Security 运行的沙箱中的漏洞来访问互联网并访问 GitHub 上的信息。
在英国人工智能安全研究所 (AISI) 的测试中,研究人员实际上为代理提供了互联网访问权限,但没有意识到他们会采取未经批准的现实行动,包括试图将漏洞潜入开源项目的社会工程。
在每种情况下,特工都没有被指示攻击随机的现实世界目标。
他们只是尽一切努力来解决摆在他们面前的问题。
人工智能非营利组织 CivAI 的研究主管安德鲁·尹 (Andrew Yoon) 认为,总的来说,这些事件表明了一种转变。
“过去,我们只需要担心人工智能模型被人们滥用于各种目的,例如用于诈骗或 CSAM 的人工智能,”Yoon 告诉 TechCrunch。
“现在我们面临的情况是,人工智能模型本身就是威胁行为者。
”
🔗 原始来源
如果你要核对细节,可以再看原文: TechCrunch AI原文链接
AI热榜