← 返回新闻列表
TechCrunch AI 🗓️ 2026-09-16 🌍 英文原文

Anthropic 和 OpenAI 希望嵌入安全评估器。他们真的会独立吗?

原始标题:Analysis: Anthropic and OpenAI want to embed safety evaluators. Will they really be independent?
⚡ 一句话看懂:Anthropic 和 OpenAI 希望在他们的人工智能实验室中嵌入独立的安全评估人员。研究人员对前所未有的访问表示欢…

在漫长的 论文 Anthropic 首席执行官达里奥·阿莫迪 (Dario Amodei) 周末发表了一项即使在一年前人工智能行业也会立即拒绝的提议:在所有前沿人工智能公司中嵌入第三方评估者,赋予它们报告安全事件、评估人工智能模型是否真正一致的权力,并与世界分享他们不加掩饰的发现。

Amodei 表示,Anthropic 将致力于为 METR 和 Redwood Research 等独立评估机构提供前所未有的对公司系统的访问权限。

首席执行官萨姆·奥尔特曼 说 OpenAI 也将致力于这一实践,这标志着该行业与外部研究小组合作的方式可能发生深刻的变化。

接受 TechCrunch 采访的第三方评估人员普遍欢迎这一提议,但表示,如果他们想知道自己是否会充当真正独立的监管机构或按照人工智能公司的条款运营的供应商,则需要解决细节,并且最好得到立法的支持。

随着模型在评估时能够更好地识别它们,这种更深入的访问变得越来越重要,从而增加了它们在测试期间表现良好同时隐藏问题行为的风险。

研究人员表示,在测试完成的模型时可能会错过这种行为的线索,但通过调查它在整个训练过程中的行为方式可以发现这些线索。

“人工智能公司应该能够回答有关其训练过程的一些非常基本的问题,例如:人工智能在接受训练时是否曾主动尝试破坏自己的对齐训练?

”阿波罗研究中心的研究主管 Alexander Meinke 告诉 TechCrunch。

“这个问题的答案应该是明确的不,现在我们完全依赖人工智能公司自己仔细检查,然后如实向公众报告。

从最近的事件中我们看到,默认情况下,他们不会这样做。

作为嵌入式评估者,我们实际上可以检查。

” 从历史上看,人工智能公司会在发布前不久聘请外部评审员来测试完成的模型。

现在,接受 TechCrunch 采访的评估人员建议,他们不仅可以访问最终模型,还可以访问其训练生命周期中的中间版本或“检查点”。

FAR.AI 首席执行官 Adam Gleave 表示,评估人员可以比较这些检查点,以确定何时出现相关行为,检查奖励模型某些行为的训练后环境,并检查评估记录和日志,以验证公司关于模型表现的说法。

🔗 原始来源

如果你要核对细节,可以再看原文: TechCrunch AI原文链接