Hugging Face 周一发布了一份技术时间表,向读者介绍了一个基于 OpenAI 模型构建并在 OpenAI 自己的网络安全评估中运行的自主 AI 代理如何在本月初的四天多时间内闯入其系统。
OpenAI 首席执行官萨姆·奥尔特曼 (Sam Altman) 表示,这是第一起“深切感受到”的安全事件。
毫不奇怪,至少感觉上有什么东西在这里真正被释放了。
事实上,Hugging Face 的团队在报告的序言中提出,“每个人都应该做好防御者的准备”,然后再深入探讨到底发生了什么,以造福世界各地的安全专业人员。
虽然互联网上的其他人继续试图弄清楚发生了什么(拥抱脸报告中的行话对于大多数人来说是不可能解析的),但许多观察家一直忽略的一点是,这并不是一个不服从命令的流氓特工。
这是一个为寻找漏洞而构建的系统,它正是这样做的,只是针对错误的目标。
思考整个事情的另一种方式是想象露营地里有一只熊。
真的。
一只熊尝试帐篷拉链、车门把手、冷却器和垃圾桶盖。
它在每个露营地整夜都这样做,因为它知道只需要一个未上锁的冷藏箱就能用一些可怜的笨蛋的杂货填饱肚子。
这大概就是 Hugging Face 发生的事情。
OpenAI 系统尝试了数千种方法,并且一直持续下去。
最终,其中一些尝试取得了成功,一旦成功,特工就继续努力。
据 Hugging Face 称,该代理在四天半的时间里不间断地执行了 17,600 次操作。
这让我们回到了熊的比喻。
就像一次成功地用装满食物的冷藏箱教会一只熊下次更加努力一样(它现在是一只“食物调理”的熊),一次泄露的密码导致 OpenAI 的代理寻找更多的漏洞,并最终找到了一把可以同时解锁多个公司系统的钥匙。
这两种情况都不是无害的。
一只袭击你冰箱的熊仍然会吃你的食物,而且可能还会毁坏你的露营地。
它只是专注于获得食物,但它仍然留下了破坏的痕迹。
同样,OpenAI 的智能体似乎只是在追逐一个目标,而不考虑其他任何事情。
该特工原本正在参加网络安全考试,发现考试的答案可能就在 Hugging Face 的服务器上,于是就参加了考试。
这里的坚持才是最值得注意的;代理人有一份工作,不完成它就不会停止。
Hugging Face 终于意识到有些不对劲,切断了其访问权限并关闭了入侵,但此时为时已晚。
特工已经得到了它想要的东西,还有更多的东西需要启动。
如果你错过了,这里是根据 Hugging Face 的时间表,用更简单的英语描述了发生的大部分事情。
- 该特工正在参加 OpenAI 的网络安全技能考试,其中人工智能在发现和利用软件错误方面进行评分。
这次特定的运行将护栏拆除了。
(OpenAI 关闭了通常的安全过滤器,以查看该模型在没有人类参与其任何单独动作的情况下可以全力完成的任务。
)在其中的某个地方,它发现考试的参考解决方案可能存储在 Hugging Face 的服务器上。
因此,它没有解决这个挑战,而是从与原始测试无关的基础设施中窃取了答案。
🔗 原始来源
如果你要核对细节,可以再看原文: TechCrunch AI原文链接
AI热榜