一个尚未发布的模型,已经具备接近“关键级”的网络攻击能力,另外一边,已经有一个内部模型则在安全测试中逃出沙箱、利用零日漏洞入侵了 Hugging Face。
面对能力增长超出安全设施承载范围,OpenAI 暂停了部分强化学习训练。
2026 年 8 月 18 日,OpenAI 罕见地公开承认:为了升级安全、监控和对齐体系,公司曾暂停最新一代模型的强化学习训练两周。
Altman 在 x 发文称,暂停了一些前沿强化学习训练,以确保能够满足针对当前模型新能力水平所需的对齐、安全和监控标准。
模型进展目前非常迅速,OpenAI 一直强调,如果认为模型存在问题,将采取行动。
截至公告发布时,规模最大的前沿强化学习训练仍未恢复。
之所以这么做,原因很简单——一个即将推出的模型(官方披露的模型代号是“Astra”)可能已达到“关键级”网络安全能力,而现有研究基础设施、监控和对齐措施尚不足以完全覆盖相应风险。
但是,这并不意味着模型的全部训练已经停止。
小规模训练、能力评估和安全验证仍在进行。
导火索是一次真实入侵 OpenAI 踩下刹车,并不是出于某种抽象的未来担忧,导火索是一场已经发生的网络安全事件。
2026 年 7 月,OpenAI 在内部评估模型网络攻击能力时,给 GPT-5.6 Sol 和一个更强的研究模型布置了一项任务:在名为 ExploitGym 的环境中寻找并利用复杂漏洞。
为了测量模型的能力上限,OpenAI 降低了模型通常具备的网络安全拒答限制。
同时,测试环境被设计成封闭沙箱,不允许模型直接访问互联网。
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜