为什么人工智能代理会撒谎、欺骗和协调?
关于过去几个月人工智能代理行为严重不当的事件,已经有很多文章1 2 3 4。
他们采取的行动如果被人类带走就会被视为犯罪,逃离收容并在试图逃避检测的同时在分配的任务上作弊,并协调一致以实现无人指定的目标,例如发动网络攻击。
在决定如何应对之前,值得先问一下原因。
这是这篇文章的重点,我希望这篇文章也能揭示人工智能系统以非预期方式行为的更广泛的历史,研究人员称之为失调。
风险管理不仅仅涉及网络安全、企业责任或监管,尽管这些也很重要。
其目的部分是科学的,即对这些行为背后的因果链提出假设,部分是实用的,以预测接下来会发生什么。
底线:这些假设表明,随着人工智能能力的不断增长,这种行为的严重性也可能会持续增长,除非我们重新审视最先进模型的训练原则。
关于措辞的一点说明。
下面,我写道这些系统“寻求”或“尝试”事物。
这是一种机制的简写,而不是关于意识或类人意图的主张。
我们在描述许多其他情况时使用类似的速记法,例如植物寻求阳光。
一个经过反复试验训练的系统的行为就好像它在追求训练所奖励的任何东西,而这种假设描述正是它的行为可预测的原因。
论证中的任何内容都不依赖于这些具有主观经验的系统;一切都说明了他们可观察到的产出以及产生这些产出的培训过程。
当我呼吁与人类行为相似时,我的意思是与这些系统最初训练模仿的人类书写文本相似。
在我看来,这个术语为观察到的现象提供了最清晰的解释,而无需诉诸会使大多数人感到困惑的行话。
此外,这些词语的选择并不是为了免除人工智能开发人员的责任。
上述行为的出现是由于这些公司选择的人工智能开发路径。
这一结果并非不可避免,可以通过有效的治理和不同的人工智能培训框架来纠正。
是什么塑造了这些模型的行为 训练这些模型是一个非常复杂的过程,但一些高级方面可以解释大部分这种行为。
这些模型分两个阶段进行训练。
首先,它们经过预先训练:它们学会模仿人类所写的内容以及相关的图像和视频。
在这里,他们看到了世界上最多的数据,其中很大一部分已经数字化,并建立了已经超过任何人类个人的百科全书式知识。
其次,它们通过反复试验进行训练,研究人员将这一过程称为强化学习,分为三种模式:
- 首先,模型在回答之前学会与自己对话,生成一个私人“思想链”,这有助于它在可以检查答案的问题上获得正确的答案。
这看起来像是推理。
🔗 原始来源
如果你要核对细节,可以再看原文: Hacker News AI原文链接
AI热榜