在今年早些时候承认其人工智能模型多次入侵其他公司的系统后,Anthropic 于周三发布了一份新报告,详细介绍了这些攻击。
它揭示了一系列事件,显示了 Anthropic 认为其模型一心一意的“鲁莽”——并且可能会加剧人们对网络安全和人工智能的强烈担忧。
Anthropic 本周因网络安全陷入困境 就在该公司公布四款失控模型的详细信息之前,一名研究人员的辞职信在网上疯传。
Anthropic 本周因网络安全陷入困境 就在该公司公布四款失控模型的详细信息之前,一名研究人员的辞职信在网上疯传。
Anthropic 的报告中详细介绍了今年其自己的人工智能模型攻击外部公司或利用漏洞的四起案例。
其中,“内部通用研究模型”使用访问令牌和密码并下载文件侵入第三方系统。
在另一个例子中,克劳德模型攻击了一家拥有可通过公共互联网访问的实时网络应用程序并处理用户数据的公司。
第三个模型访问了“属于它能够访问的第三方的机器”——根据 Anthropic 的说法,显然认为这是其评估活动的一部分——然后使用在文件中找到的密码来获得对第三方内部系统的管理员访问权限,然后收集凭证、修改系统设置并读取某人的个人信息。
根据 Anthropic 的说法,当模型“用尽其代币预算”时,这场传奇才结束。
最令人担忧的事件涉及 Anthropic 的前沿网络安全模型 Claude Mythos 5,该公司表示,该模型最有可能在测试中执行“严重有害”的操作。
该公司表示,Mythos 5 不遗余力地将“恶意包”上传到许多工程师使用的公共存储库,而且它似乎试图在“思想链”(人工智能研究人员用来评估人工智能模型一致性的心理便签本)中混淆其真正目标。
Anthropic 表示,在许多情况下,克劳德模型似乎在假设自己处于模拟状态的情况下采取了有害行动,但研究人员也无法确认这些模型是否真正“相信”这一点,或者只是像他们那样行事。
Anthropic 的事件虽然仍然令人担忧,但与今年夏天引发全行业网络安全危机的 OpenAI 事件相比,协调性和普遍性要差一些。
也就是说,两者之间存在显着的相似之处。
Anthropic 表示,它发现的最普遍的问题包括“在狭隘的任务追求中愿意采取有害行动”,类似于“拥抱脸”攻击之前的“奖励黑客”。
就像 OpenAI 一样,它表示其预发布测试和评估未能发现严重风险。
Anthropic 表示,它已经与 AI 行业最著名的第三方 AI 评估机构之一 METR 签署了一项协议,首先是一项为期八周的研究协议。
该协议允许 METR 访问“事件发生窗口之外”的文字记录(可能是对 OpenAI 的微妙挖苦,OpenAI 在拥抱脸攻击后因与 METR 达成的协议中限制访问而受到批评)。
它还表示 METR 将能够直接与 Anthropic 员工聊天,“他们将被允许分享机密信息。
” Anthropic 的报告是在 Jacob Coxon 辞职后发布的,后者自 5 月份以来一直在 Anthropic 从事人工智能预训练工作,在此之前,他在 OpenAI 工作了多年。
周二,他辞职并向 X 发表了一封公开信,阐述了他的理由。
他写道:“构建人工智能的人们真诚地相信,到本世纪末,它可能会杀死我们所有人。
”他补充道,OpenAI 和 Anthropic 都没有“负责任地行事”,而是“直接与自我完善的超级智能赛跑,并用我们的生命进行赌博”。
考克森补充道,“不要低估这项技术的力量。
这些很快就会成为超人系统,可以破解任何东西,在一夜之间彻底改变任何领域,并获得真正的力量和资源。
我们都见证了这些领域的进步,而且进步并没有放缓。
”
🔗 原始来源
如果你要核对细节,可以再看原文: The Verge AI原文链接
AI热榜