← 返回新闻列表
TechCrunch AI 🗓️ 2026-08-13 🌍 英文原文

人类让人工智能代理松散地执行同一任务。他们开始了地盘争夺战。

原始标题:Latest: Anthropic set AI agents loose on the same task. They started a turf war.
⚡ 一句话看懂:人类研究人员发现,人工智能代理可能会以意想不到的方式发生冲突、共谋和协调,这引发了新的问题:当今的安全测试是否能够捕捉到…

当人工智能代理相互对抗时会发生什么?

根据 Anthropic 的测试,事情很快就会变得混乱。

周四,Anthropic 的 Frontier Red Team 发布了 新研究 研究人工智能代理群体在野外相遇时的行为方式。

这些发现让我们了解了随着公司和政府采取跨共享代码库、市场和计算机系统自主工作的代理而可能出现的潜在风险。

在一项实验中,Anthropic 允许三个 Claude 代理访问同一个软件项目,每个项目都有自己不兼容的指令来说明如何处理它。

这些特工没有被告知还有其他特工在从事同一个项目,因此研究人员可以观察他们交叉时发生的情况。

“我们一直看到一场多智能体的地盘争夺战,”人类研究人员写道。

这些模型都假设其他模型“故意阻碍他们的工作”,并开始用“越来越具有攻击性、自我复制的恶意软件”互相破坏。

这项研究是在几起备受瞩目的事件之后进行的 来自 Anthropic 的代理 和 OpenAI 逃离沙箱

🔗 原始来源

如果你要核对细节,可以再看原文: TechCrunch AI原文链接