这个故事最初出现在我们关于人工智能的每周通讯《算法》中。
要首先在您的收件箱中收到此类故事,请在此处注册。
上周,当我读到 OpenAI 的一些模型如何突破遏制并侵入另一家人工智能公司 Hugging Face 的计算机系统时,我第一次对大型语言模型现在的能力感到真正的寒意。
但这是人类傲慢的表现,而不是流氓人工智能的表现。
我不是危言耸听者。
事实上,多年来我一直在反对人工智能的恐慌故事。
即便如此,这起事件还是越界了。
我认为这是迄今为止最清晰的说明,说明构建和测试这项技术的人们并不完全理解他们在做什么。
OpenAI 可以而且应该预见到这一点。
至少根据两家相关公司的说法,发生了这样的事情。
几周前,OpenAI 开始测试其一些新模型的黑客能力,包括 GPT‑5.6 Sol(6 月发布)以及 OpenAI 所描述的“功能更强大的预发布模型”。
OpenAI 将其模型与 5 月份发布的名为 ExploitGym 的基准进行比较,该基准要求法学硕士找到利用常用软件中发现的现实漏洞的方法。
为了看看他们能做什么,研究人员拆除了大部分网络安全护栏。
然后,他们在沙箱内运行模型,该沙箱与互联网隔绝,只有一个第三方软件的链接充当外部世界的代理,并让他们安装击败 ExploitGym 所需的代码。
7月9日,据路透社报道,OpenAI的模型开始尝试突破代理。
他们在代理软件中发现了一个未知的错误,并用它来访问互联网。
从那里,他们于 7 月 11 日侵入了 Hugging Face 的计算机系统,显然是在寻找可以帮助他们完成任务的数据集和解决方案。
Hugging Face 于 7 月 16 日宣布了此次黑客攻击。
直到 7 月 21 日,OpenAI 才意识到(或者至少没有透露)其模型参与其中,即它们突破遏制约 10 天后,以及 Hugging Face 停止攻击并向 FBI 发出警报一周后。
OpenAI 在提交给《麻省理工学院技术评论》的一份声明中表示:“我们正在与外部顾问一起并在我们的安全和安保委员会的监督下进行彻底的审查。
一旦审查完成,我们将向所有人发布我们所学到的技术报告。
”该公司还证实,其研究人员当时正确使用了现有的安全指南和程序。
叫醒服务
🔗 原始来源
如果你要核对细节,可以再看原文: MIT Tech Review原文链接
AI热榜