← 返回新闻列表
Hacker News AI 🗓️ 2026-08-13 🌍 英文原文

文本 AI 水印总是很容易删除

原始标题:Analysis: Text AI watermarks will always be trivial to remove
⚡ 一句话看懂:文章网址:https://www.seangoedecke.com/text-ai-watermarks/ 评论网址:h…

欧盟人工智能法案将于 2026 年 8 月(即一个月后)开始强制执行1。

其中最大的新要求之一是第 50 条,它要求所有人工智能输出“可检测为人工生成”。

换句话说,如果法学硕士提供商想要在欧盟开展业务,他们将必须在其输出中应用水印2:一些可用于识别人工智能内容的隐藏签名。

LLM文本水印是一个令人着迷的问题。

就像最好的工程问题一样,理论上很难完美解决,但有多种部分解决方案:例如,Google 的 SynthID,以及(正如我将要讨论的)来自 OpenAI 和 Anthropic 的一些安静的 Unicode 技巧。

看看人工智能实验室如何在今年年底前进行这些权衡将会很有趣。

为什么文本水印很难 我去年年底在《人工智能检测工具无法证明文本是人工智能生成的》中写过关于人工智能水印的文章。

对图像加水印很容易,因为数字图像包含大量人眼无法真正看到的噪声。

例如,您可以应用类似“这些确切点中的这二十个像素将始终共享一种颜色”的水印。

文本要困难得多。

与图像不同,文本是一种非常压缩的介质:您无法对句子进行任何人类不会注意到的更改(有一个例外,我们稍后会介绍)。

那么如何给它加水印呢?

这基本上是一个文本隐写问题(隐藏密码),由于明文不能被任意操纵,所以变得更加困难。

您为应用水印所做的任何更改都会影响输出的质量。

例如,“每五个字母都是一个‘e’”将是一个很好的水印,但天真地应用会让人工智能输出充满拼写错误。

你能让模型弄清楚如何适应水印吗?

强大的人工智能模型足够聪明,可以应对这种约束3,但它仍然会消耗推理时间,而这些时间本来可以更好地花在用户的问题上,并且使模型听起来比实际能力要差得多4。

我们需要水印来检测人工智能内容吗?

你真的需要水印吗?

如果您是人性化的,并且需要能够验证您的模型是否生成了特定的文本块,那么您是否可以简单地通过每个模型运行文本,测量模型的预测标记与文本中每个标记的匹配程度?

并不真地。

“一个问题的所有可能的克劳德十四行诗答案”的空间比“一个问题的所有可能的加水印答案”的空间大得多。

换句话说,对于读起来就像是人工智能编写的人类文本,你会得到太多误报。

人类意外地像克劳德一样书写的可能性比人类意外地复制水印的可能性要大得多。

针对一段文本运行每个 Anthropic 模型以对其添加水印的成本也将非常昂贵。

欧盟人工智能法案最终将要求像 Anthropic 这样的实验室向每位欧盟公民提供免费水印服务(参见承诺 2)。

你无法通过“运行模型”的方法来做到这一点。

SynthID 的工作原理

🔗 原始来源

如果你要核对细节,可以再看原文: Hacker News AI原文链接