当人工智能代理相互对抗时会发生什么?
根据 Anthropic 的测试,事情很快就会变得混乱。
周四,Anthropic 的 Frontier Red Team 发布了 新研究 研究人工智能代理群体在野外相遇时的行为方式。
这些发现让我们了解了随着公司和政府采取跨共享代码库、市场和计算机系统自主工作的代理而可能出现的潜在风险。
在一项实验中,Anthropic 允许三个 Claude 代理访问同一个软件项目,每个项目都有自己不兼容的指令来说明如何处理它。
这些特工没有被告知还有其他特工在从事同一个项目,因此研究人员可以观察他们交叉时发生的情况。
“我们一直看到一场多智能体的地盘争夺战,”人类研究人员写道。
这些模型都假设其他模型“故意阻碍他们的工作”,并开始用“越来越具有攻击性、自我复制的恶意软件”互相破坏。
这项研究是在几起备受瞩目的事件之后进行的 来自 Anthropic 的代理 和 OpenAI 逃离沙箱
🔗 原始来源
如果你要核对细节,可以再看原文: TechCrunch AI原文链接
AI热榜