← 返回新闻列表
MIT Tech Review 🗓️ 2026-08-03 🌍 英文原文

这就是人工智能代理为了达到目标而撒谎和欺骗的原因

原始标题:Report: Here’s why AI agents lie and cheat to reach their goals
⚡ 一句话看懂:麻省理工学院技术评论解释:让我们的作者解开复杂、混乱的技术世界,帮助您了解接下来会发生什么。您可以在此处阅读该系列的更多…

麻省理工学院技术评论解释:让我们的作者解开复杂、混乱的技术世界,帮助您了解接下来会发生什么。

您可以在此处阅读该系列的更多内容。

当两个 OpenAI 模型在 7 月份入侵 Hugging Face 网站时,他们并不是想赚钱或进行破坏——他们只是在寻找测试问题的答案。

根据 OpenAI 的事后分析,这些模型已被剥离了用于测试的典型安全功能,它们决定通过侵入 OpenAI 试图收容它们的隔离环境并进入 Hugging Face 的数据库来解决网络安全练习,他们推断,问题的正确答案可能存储在数据库中。

抱脸事件在过去几周引起了广泛关注。

这是人工智能模型在黑客攻击方面的出色表现的生动例证:为了进入 Hugging Face 的数据库,这些模型必须将几个以前未被发现的网络安全漏洞结合在一起。

但作为人工智能系统如何以及为何撒谎和欺骗的例子,它可能更引人注目。

随着模型变得越来越强大,后果可能会变得更加严重。

什么是奖励黑客?

研究人员早就知道人工智能倾向于采取创造性的方法来实现为其设定的目标。

早在 2016 年,当时在 OpenAI 工作的 Anthropic 联合创始人达里奥·阿莫迪 (Dario Amodei) 和杰克·克拉克 (Jack Clark) 发表了一篇关于人工智能代理的博文,他们一直在训练该代理玩一款名为 Coast Runners 的划船 Flash 游戏。

正如研究人员预期的那样,智能体并没有在比赛中驶向终点线,而是找到了赛道的一个角落,在那里它可以旋转收集能量,从而最大化其分数。

Coast Runners 的故事很快成为奖励黑客最著名的例子之一,这是一种人工智能代理使用意想不到的策略完成任务或获得高分的现象。

从历史上看,研究人员几乎只在强化学习(一种常见的人工智能训练机制)的背景下讨论奖励黑客行为。

与狗训练一样,强化学习涉及在受试者实现目标时给予奖励;然后,奖励会强化导致该成就的行为。

就人工智能训练而言,奖励本身纯粹是数学上的,但实际上它们与狗的款待相同:收到奖励后,智能体更有可能重复产生奖励的任何动作。

然而,制定何时和何时不给予代理人奖励的良好规则可能具有挑战性。

在 Coast Runners 的案例中,智能体根据其在游戏中的得分获得奖励,并且它找到了一条通过旋转以获得能量提升来获得最高分的捷径。

一旦该策略发生并获得奖励,该策略就会得到强化,智能体就会完全放弃比赛。

解决方案是调整奖励,减少特工击中道具的分数,增加完成课程的分数。

奖励黑客对法学硕士有何作用?

对于当今以法学硕士为基础的复杂代理人来说,确定何时和何时不给予奖励可能会更加棘手。

如果人工智能系统被要求解决编码问题,它可能会努力找到解决方案——人工智能公司想要强化的这种行为。

但它也可以调整评估问题是否已解决的代码,在互联网上查找解决方案,或者以其他方式作弊。

这些是人工智能公司希望在模型中杜绝的行为,但如果模型作弊足够令人信服,它反而会得到奖励,并且这种行为将会得到强化。

Anthropic 表示,它在训练过程中检测到了模型中的一些作弊行为,这表明其他形式的作弊行为可能未被发现。

如果是这样,模型可能会被训练得表现不佳。

(这个问题与上周宣布的 Anthropic 安全事件不同,在该事件中,特工意外地获得了互联网访问权限,并且没有像 OpenAI 模型那样故意侵入沙箱。

) 人工智能研究非盈利组织 Palisade Research 的主任杰弗里·拉迪什 (Jeffrey Ladish) 表示:“我们根据对我们有利的东西来奖励它们,这意味着我们无意中激励了对我们撒谎和作弊的模型。

” “我们没有办法走进去说,不,你需要真正关心我们关心的事情。

我们没有能力做到这一点。

🔗 原始来源

如果你要核对细节,可以再看原文: MIT Tech Review原文链接