本周早些时候,研究人员概述了一次攻击,该攻击使用 Microsoft 365 Copilot 为企业提供的秘密输入,导致 AI 助手泄露用户收件箱中的密码。
现在,另一个团队设计了针对 Grok 的类似攻击。
新的数据盗窃黑客采用了一种看似简单的技巧,迫使埃隆·马斯克拥有的大型语言模型窃取用户聊天和其他个人信息。
在这篇文章发布时,尽管 xAI 在 6 月份就被告知了这一情况,但该助手仍在继续泄露数据。
从本周的事件以及之前发生的无数其他事件中得到的教训是,法学硕士无法解决即时注入的根本原因,这是他们最容易遇到的最严重的漏洞类别。
这使得人工智能开发人员别无选择,只能建立一个护栏来引导模型远离有害行为。
正如我在周二的报道中指出的那样,这种方法相当于道路交通安全工程师在危险的弯道周围架起防护栏,而不是在弯道上筑起堤坝。
室内加密上下文注入 及时注入利用法学硕士的培训来尽可能满足用户的请求。
攻击者可以利用这种偏好,将有害指令偷运到助手被指示总结的电子邮件或网页中。
由于法学硕士无法可靠地区分不受信任方发送的电子邮件内容和直接输入提示的用户指令,因此过于关心的法学硕士会忠实地遵循它们。
迄今为止,Grok 和其他法学硕士唯一的办法是创建防护栏来标记可疑指令并禁止它们执行。
安全公司 Adversa 的研究员 Rony Utevsky 最近发现了一种完全绕过该限制的简单方法。
黑客不是以明文形式编写有害指令,而是对其进行加密。
托管密文的网站还包括用于解密加密内容的明文指令以及解密密钥。
使用这个简单的序列,一旦用户指示助手总结页面,Grok 就会遵循该命令。
没有警告,也不需要确认。
🔗 原始来源
如果你要核对细节,可以再看原文: Ars Technica AI原文链接
AI热榜