这个故事最初出现在我们关于人工智能的每周通讯《算法》中。
要首先在您的收件箱中收到此类故事,请在此处注册。
现在你可能已经听说过上个月发生的重大人工智能安全事件,其中 OpenAI 代理在试图作弊时逃离了沙箱并侵入了人工智能平台 Hugging Face。
这是一个疯狂的故事。
周三,OpenAI 发布了有关该事件的事后技术报告,我在这里写了该报告。
在 OpenAI 发布该报告的前一天,我与计算机科学教授、著名对齐专家 David Krueger 进行了交谈,他从蒙特利尔大学休假,创建并领导了一家名为 Evitable 的人工智能安全非营利组织。
他表示,他真正希望在报告中看到的是对事件背后人为因素的分析。
他说:“当你审视事故和事件时,人们常常试图找到故障的技术根源,但这可能会给故障发生的原因带来非常不准确和误导性的认识。
” “如果人们总是偷工减料,如果人们没有处于一种优先考虑安全的文化中,并且没有适当的激励措施和结构,那么[事故]就一定会发生。
” 这份报告并没有满足克鲁格的希望。
其 38 页详细介绍了特工不当行为长达数月的进展情况,最终导致 Hugging Face 黑客攻击,探讨了发生不当行为的技术原因,并列举了为防止未来发生类似事件而采取的步骤。
但报告没有考虑公司文化在该事件中可能发挥的作用,报告也很少提及具体的人为错误。
这更令人担忧,因为报告中提到的人为错误表明,可能存在重大的文化问题。
早在五月份,训练中的模型就弄清楚了如何通过临时留言板相互交流,OpenAI 团队观察了这一行为。
由于这种行为发生在训练期间,模型了解到秘密的代理间通信是完成任务的可行策略,但团队没有重新启动训练过程,而是允许模型继续使用权重中编码的风险信息。
当这些模型在 6 月底进行测试时,他们再次创建了一个留言板,从而启用了拥抱面部攻击。
这个留言板也被发现了,但做出回应的员工决定评估可以继续,报告表明,指挥链上层没有人意识到发生了什么,直到为时已晚。
Substack 上受欢迎的 AI 安全作家 Zvi Mowshowitz 表示:“要以这种方式失控,需要发生一系列很长的故障,一系列级联故障会导致越来越大的足迹,如果有人在任何时候注意到并发出警报,这应该结束。
”Zvi Mowshowitz 引起了人们对 OpenAI 在第一个留言板被发现后未能停止训练的关注。
报告称,OpenAI 员工在多个地点注意到了正在发生的事情,但要么没有发出警报,要么在发出警报时没有被听到。
OpenAI 的报告未能解决的是,为什么一家开发如此高风险系统的公司未能阻止这种严重的通信故障,尽管莫肖维茨对此表示怀疑。
“所有这些不同的失败都指向同一个方向,那就是 OpenAI 的安全文化不存在或非常薄弱,”他说。
当然,仅仅因为我们在报告中没有看到对安全因素的深入分析,并不意味着 OpenAI 没有在内部进行分析。
但在给《麻省理工科技评论》的一封电子邮件中,约翰·霍普金斯大学名誉教授、组织安全专家凯瑟琳·萨克利夫 (Kathleen Sutcliffe) 对公开报告没有包含对公司实践和文化的任何反思表示担忧。
她写道:“人们互动的方式——我们在组织生活中的日常习惯、例行公事和实践——会影响我们对正在发生的事件保持警觉和了解的能力,影响我们理解所见事物的能力,并最终影响我们应对事件发生的能力。
”
🔗 原始来源
如果你要核对细节,可以再看原文: MIT Tech Review原文链接
AI热榜