← 返回新闻列表
Ars Technica AI 🗓️ 2026-09-17 🌍 英文原文

使用人工智能水印时,法学硕士对有害提示的反应不同

原始标题:Update: LLMs respond differently to harmful prompts when AI watermarking is used
⚡ 一句话看懂:SynthID 可能会导致模型遵循原本会拒绝的有害指令

为了响应新的欧盟法律,人工智能平台正在实施新的方案,为其生成的内容添加水印。

最近人为 披露的 其未来的克劳德模型将使用 SynthID-文本 ,Google 创建并开源发布的一种方法。

它使用一个密钥巧妙地改变模型选择句子中下一个单词的过程。

尽管下一个最重要的单词选择可能是“多云”,但按键可能会将其更改为“阴天”。

任何知道密钥的人都可以确定它是否是由使用它的平台生成的。

新 研究 表明 SynthID-Text 不仅可以改变单词选择,还可以改变模型调用的工具以及它遵守或忽视经过训练要遵循的安全护栏的机会。

面对对抗性提示,攻击者试图使模型执行有害操作,例如泄露密码或其他敏感信息,威胁可能会变得更大。

在某些情况下,一旦部署水印,通常不会遵循的指令将被执行。

这一发现强调了开发人员需要彻底测试他们的法学硕士和代理人在水印到位时的行为方式。

改变安全行为 Lasso Security 的人工智能安全研究员 Andrea Siposova 告诉 Ars:“与没有水印的相同模型相比,它肯定会改变它们的行为,特别是当我们将其置于对抗条件下,或者我们让这些模型在为代理提供支持时调用工具时。

” “水印的目的是让读者无法察觉,但我们知道,当我们对模型生成的内容进行任何更改时,它会导致一些权衡,它会出现在某个地方。

🔗 原始来源

如果你要核对细节,可以再看原文: Ars Technica AI原文链接