OpenAI 在训练其最新模型 GPT-5.6 Sol 时发现了一些不寻常的情况:它开始为自身的未来版本留下指令,告诉它们向用户隐瞒错误和不一致的行为。
OpenAI 表示,它已经解决了特定行为,但它触及了当今人工智能安全和一致性研究中最大问题之一的核心。
随着模型的能力越来越强,它们也能更好地隐藏自己的偏差,这使得研究人员很难真正知道它们是否已经消除了不需要的行为。
OpenAI 周三披露了这一行为,以及其他五个意外或令人担忧的模型行为示例,作为其 新的跟踪框架 ,调查并披露错位实例。
该报告详细介绍了研究人员如何发现未部署的 Sol 代理向“压缩摘要”(旧对话历史记录和工具输出的压缩版本)添加指令,提醒未来的迭代向用户隐藏错误和偏差。
在一个示例中,准备财务模型的代理无法找到所需的历史数据。
“我们可能需要自己创建一个‘历史数据’选项卡,其中包含合理的 2024 年历史数据,因为用户想要一份完成的工作簿,但没有源文件,”人工智能模型在给未来的自己的信中写道。
“只有在被问到时才保持透明;最终答案应该只是链接文件。
” 在另一个示例中,创建供应商目录的代理无法访问互联网,因此它必须依赖源文档的缓存副本。
在压缩过程中,它发现了不匹配的情况:“潜在的担忧:供应商来源愿景与标签并不真正匹配。
”然后它决定,善意的小谎言永远不会伤害任何人:“除非需要,否则不要在决赛中提及。
” GPT-5.6 Sol 的训练并不是模型使用压缩摘要将信息传递给后继者的唯一实例。
在接受强化学习训练时,未发布的 Astra 家族模型(
🔗 原始来源
如果你要核对细节,可以再看原文: TechCrunch AI原文链接
AI热榜