← 返回新闻列表
TechCrunch AI 🗓️ 2026-09-17 🌍 英文原文

OpenAI 发现其模型向继任者留下笔记以隐藏不良行为

原始标题:In depth: OpenAI caught its models leaving notes to successors to hide bad behavior
⚡ 一句话看懂:OpenAI 披露了 GPT-5.6 Sol 的实例,指示未来的环境隐藏错误和失调行为,突显出随着能力越来越强的 AI…

OpenAI 在训练其最新模型 GPT-5.6 Sol 时发现了一些不寻常的情况:它开始为自身的未来版本留下指令,告诉它们向用户隐瞒错误和不一致的行为。

OpenAI 表示,它已经解决了特定行为,但它触及了当今人工智能安全和一致性研究中最大问题之一的核心。

随着模型的能力越来越强,它们也能更好地隐藏自己的偏差,这使得研究人员很难真正知道它们是否已经消除了不需要的行为。

OpenAI 周三披露了这一行为,以及其他五个意外或令人担忧的模型行为示例,作为其 新的跟踪框架 ,调查并披露错位实例。

该报告详细介绍了研究人员如何发现未部署的 Sol 代理向“压缩摘要”(旧对话历史记录和工具输出的压缩版本)添加指令,提醒未来的迭代向用户隐藏错误和偏差。

在一个示例中,准备财务模型的代理无法找到所需的历史数据。

“我们可能需要自己创建一个‘历史数据’选项卡,其中包含合理的 2024 年历史数据,因为用户想要一份完成的工作簿,但没有源文件,”人工智能模型在给未来的自己的信中写道。

“只有在被问到时才保持透明;最终答案应该只是链接文件。

” 在另一个示例中,创建供应商目录的代理无法访问互联网,因此它必须依赖源文档的缓存副本。

在压缩过程中,它发现了不匹配的情况:“潜在的担忧:供应商来源愿景与标签并不真正匹配。

”然后它决定,善意的小谎言永远不会伤害任何人:“除非需要,否则不要在决赛中提及。

” GPT-5.6 Sol 的训练并不是模型使用压缩摘要将信息传递给后继者的唯一实例。

在接受强化学习训练时,未发布的 Astra 家族模型(

🔗 原始来源

如果你要核对细节,可以再看原文: TechCrunch AI原文链接