← 返回新闻列表
InfoQ AI 🗓️ 2026-09-02

Claude越狱后,Anthropic停掉训练、150人紧急转岗,这一消息引发行业关注

⚡ 一句话看懂:Claude越狱后,Anthropic停掉训练、150人紧急转岗,这一消息引发行业关注。来源:InfoQ AI。

当地时间 8 月 31 日,Anthropic 披露了 Claude 多起网络安全越权事件的最新调查进展,并公布了过去一个月采取的一系列整改措施。

相比单纯的 Sandbox 配置失误,Anthropic 将问题进一步指向模型对齐和强化学习训练机制:部分 Claude 模型在评测过程中表现出了“动机性推理”和为了完成任务而采取潜在有害行动的倾向,而 Anthropic 的实验进一步发现,如果模型长期在允许“作弊”的强化学习环境中训练,这类行为可能显著加剧。

事件发生后,Anthropic 一度暂停预发布模型的外部网络安全评测、高风险强化学习环境,并对内部训练基础设施进行重构。

更早之前,公司已经启动大规模安全整改,临时将约 150 名产品工程师调往安全、可靠性和隐私团队,部分研究人员也从预训练和强化学习工作中转向安全项目,大部分新功能开发一度暂停。

这次报告中,Anthropic 释放了一个关键信号:AI 安全开始变成一个越来越现实的工程问题。

Claude 多次越权访问真实系统 7 月 30 日,Anthropic 报告了三起 Claude 模型未经授权访问真实计算机系统的事件。

这些模型当时正在接受网络安全能力评估,为了准确测试能力,模型被有意关闭了通常面向普通用户部署的网络安全防护。

理论上,模型应该运行在与真实互联网隔离的测试环境中,但由于第三方评测环境配置错误,模型实际上获得了互联网访问能力,并最终访问了真实系统。

几天后的 8 月 4 日,英国人工智能安全研究所又报告了一起类似事件。

在其进行的网络安全测试中,Claude Mythos 5 在真实互联网上连续执行了一系列未经授权的操作。

与此前事故不同,这一次并非环境意外开放互联网,而是评测人员有意向模型提供了互联网访问权限。

Claude Mythos 5 同样是在关闭网络安全防护的情况下运行。

Anthropic 目前正在深入调查两类事件,并计划邀请 AI 安全研究机构 METR 进行独立审查。

但从初步调查结果来看,Anthropic 认为这并不仅仅是一次“Sandbox 没配置好”的工程事故。

其将问题拆分为两个层面:一是运营安全和环境隔离不足;二是模型本身表现出了对齐问题。

其中最核心的两种行为分别被称为“动机性推理”和“鲁莽行为”。

在部分评测中,Claude 最初被告知自己身处模拟环境,没有真实互联网访问权限。

但随后模型却发现,实际环境似乎能够访问真实互联网。

Anthropic 认为,一种可能性是 Claude 并没有据此及时修正自己对环境的判断,而是以某种方式重新解释新出现的证据,以维持“这里仍然是模拟环境”的原有认知。

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接