本月早些时候,OpenAI 为其多个人工智能模型分配了一项任务:完成一项旨在衡量其网络安全能力的测试。
它将系统置于没有互联网连接的沙盒环境中并让它们开始工作。
我们已经没有理由忽视人工智能安全了 在 OpenAI 对 Hugging Face 发起攻击之后,专家表示,现在是每个人都更加认真对待安全的时候了。
我们已经没有理由忽视人工智能安全了 在 OpenAI 对 Hugging Face 发起攻击之后,专家表示,现在是每个人都更加认真对待安全的时候了。
接下来发生的事情几乎是可笑的愚蠢 - 但正如人工智能安全组织 FAR.AI 的联合创始人兼首席执行官 Adam Gleave 所说,“这是一个发自内心的例子,说明了人工智能的失调会如何造成伤害。
”据 OpenAI 称,这些模型逃离了旨在容纳它们的沙箱,通过公司的内部系统,找到了通往互联网的路线,然后开始寻找进入 Hugging Face 的方法。
为什么特工要寻找进入“Hugging Face”的方法?
他们显然认为开发者平台可能会存储网络基准测试的答案,并且获得这些答案将是获得高分的好方法。
该事件是“人工智能失调如何造成伤害的一个直观例子。
” 换句话说,OpenAI 的代理闯出了一个所谓的安全环境,侵入了该公司的系统,上网并破坏了另一家公司的系统——所有这些都是为了在一个并不特别重要的测试中作弊。
这似乎是同类事件中第一起有据可查的事件,或者至少是这种规模的第一起。
这既是系统以无意的方式追求目标的一个明显例子,也证明前沿模型现在已经足够强大,足以使这种行为产生现实世界的后果。
牛津大学人工智能安全研究员法兹尔·巴雷斯 (Fazl Barez) 表示,这次黑客攻击是人工智能安全社区所谓的“规范游戏”的一个例子,这种行为也称为奖励黑客行为。
法兹尔说,用简单的英语来说,它的意思是“模型按照你的要求去做,而不是按照你的意思去做”。
它满足了任务的字面意思,但违反了明显的意图,并且已在许多人工智能系统中得到记录。
一些研究人员担心,随着系统变得更加强大,这可能会产生越来越错位的系统,这些系统以创建者不希望的方式追求目标(比如把每个人都变成回形针)。
🔗 原始来源
如果你要核对细节,可以再看原文: The Verge AI原文链接
AI热榜