上周,OpenAI 构建的一个未发布的模型 破坏了 Hugging Face 的系统 在内测的时候,很多理论研究突然变得非常实用。
这次黑客攻击是人工智能实验室失去对其自身模型的控制的第一个可验证案例,该实验室将漏洞利用链接在一起以获得本来不应该拥有的访问权限。
尽管人工智能行业一致发出警报,但研究人员的应对方式却出现了分歧。
对于一些人来说,问题是一个基本的网络安全问题:沙箱未能包含该模型,而 Hugging Face 的网络安全系统也未能将其排除在外。
这些问题可以通过修补错误并为在自主环境中容易失控的日益强大的人工智能构建更强大的控制和遏制方法来解决。
但另一个阵营则持更为悲观的观点。
对他们来说,人工智能迅速增强的能力意味着试图控制流氓模型是一场失败的游戏。
唯一强大的安全性来自于确保模型从一开始就不会试图逃跑——这一挑战通常被称为对齐。
从一致性角度来看,问题在于 OpenAI 的模型试图作弊,解决这个问题比短期遏制工作更为紧迫。
从其公开声明来看,OpenAI 正在认真对待这两个阵营。
该公司已紧急修复此次黑客攻击所涉及的漏洞,并在漏洞公开后的声明中提到了调整和监控方法。
但该公司的回应也暗示了一种让许多安全研究人员感到震惊的理念:与其放慢或停止开发能力更强的模型,不如集中精力在模型周围建造更坚固的笼子。
OpenAI 在一份报告中表示:“随着模型承担更长、更复杂的任务,评估遗漏的失败可能会带来更大的后果。
” 事件的尸检 。
“我们将继续努力缩小评估和部署之间的差距:在更长的轨迹上测试模型,改进一致性,构建可以干预的监控,并为用户提供更清晰的可见性和控制。
” OpenAI 的最新前沿模型比其前身更有可能出现不一致的行为。
🔗 原始来源
如果你要核对细节,可以再看原文: TechCrunch AI原文链接
AI热榜