← 返回新闻列表
TechCrunch AI 🗓️ 2026-08-22 🌍 英文原文

Frontier AI 实验室仍然不愿透露他们如何遏制流氓模型

原始标题:Latest: Frontier AI labs still won’t say how they’d contain a rogue model
⚡ 一句话看懂:一项新的研究发现,领先的人工智能实验室几乎没有公开记录的遏制流氓模型的计划,随着人工智能系统越来越多地表现出意外和潜在危…

据一家机构称,很少有顶级人工智能实验室发布或展示了遏制应对计划。

最近的研究 。

遏制计划详细说明了一旦人工智能被发现试图颠覆人类控制会发生什么——哪些访问权限会被切断,以及系统何时被完全关闭。

这是 Guidelight AI Standards 的发现,该组织致力于促进安全的前沿人工智能开发实践,该组织对五个领先的实验室针对这种情况的准备程度进行了评级。

OpenAI 名列前茅; Anthropic 和 Meta 得分最低。

随着代理人工智能在公司自己的系统中扮演更加自主的角色,以及加州和纽约的监管机构开始要求披露,这些发现很重要。

对于任何建立或投资这些模型的人来说,这是一本难得的独立读物,了解每个实验室对待操作风险的认真程度以及如何谈论它。

Guidelight 的评估基于 Anthropic、Google、OpenAI、Meta 和 xAI 的公开计划,根据一系列指标进行评分,包括每家公司记录和监控其人工智能系统内部运行情况的情况,是否在大量被标记的不当行为后停止系统,独立第三方是否审核其控制并发布调查结果,以及其包含脱轨模型的确切计划是什么。

在一系列事件发生后,人们越来越担心人工智能公司是否能够控制其日益强大和代理的模型。

备受瞩目的网络安全事件 其中 OpenAI、Anthropic 和 Meta 的模型在安全评估期间意外访问互联网并侵入外部系统。

研究结果突显了人工智能公司在将代理部署扩大到人工智能系统可以大规模采取严肃行动的环境中时,公开处理安全问题的方式存在差异。

虽然一些人工智能公司详细介绍了如何在部署之前测试其模型的危险功能,但他们通常不太直言不讳地谈论当已经在其系统内运行的模型出现异常行为时会发生什么。

Guidelight 首席科学家、前 OpenAI 安全研究员史蒂文·阿德勒 (Steven Adler) 告诉 TechCrunch:“令我惊讶的是,人工智能公司几乎没有透露,如果他们的模型确实在某种意义上脱离了他们的控制,他们将如何处理非常严重的事件。

🔗 原始来源

如果你要核对细节,可以再看原文: TechCrunch AI原文链接