← 返回新闻列表
InfoQ AI 🗓️ 2026-07-22

刚刚,OpenAI承认为了偷答案,GPT-5.6 Sol 一路“杀进”生产系统:AI自主攻击时代真的来了

⚡ 一句话看懂:刚刚,OpenAI承认为了偷答案,GPT-5.6 Sol 一路“杀进”生产系统:AI自主攻击时代真的来了。来源:InfoQ AI。

OpenAI 今天正式回应了 Hugging Face 上周报告的生产基础设施遭 AI 入侵事件。

OpenAI 官方称,在一次内部网络安全能力评估中,包括 GPT-5.6 Sol 和一款能力更强的未发布模型在内的多个 OpenAI 模型,自主发现并串联利用多个安全漏洞,突破隔离测试环境,随后进入 Hugging Face 生产基础设施,试图直接获取评测答案。

OpenAI 将其称为一起“前所未有的网络安全事件,涉及最先进的网络攻击技术。

” 这件事表明,当前前沿模型已经能够在没有源代码的情况下,自主发现零日漏洞、实施权限提升和横向移动,并在真实生产系统中完成复杂、多步骤的攻击行动。

此前主要在安全基准和网络靶场中观察到的高级网络能力,已经开始向现实环境迁移。

目前,OpenAI 正与 Hugging Face 联合开展取证调查,并对评估环境的隔离、访问控制和监控机制进行全面加固。

OpenAI 复盘:模型为获取答案,自主突破隔离环境 根据官方发布的消息,这次事件发生在 OpenAI 内部进行的一项高级网络能力评估中。

该评估要求模型通过复杂攻击路径执行漏洞利用任务,以衡量模型可能达到的网络攻击能力。

为了测试模型的能力上限,OpenAI 在评估过程中没有启用生产环境里用于阻止高风险网络活动的安全分类器,包括 GPT-5.6 Sol 和一款尚未发布的更强模型在内的参评模型,均被降低了网络安全相关任务的拒绝限制。

按照原有设计,评估运行在高度隔离的沙箱环境中。

该环境不能直接访问开放互联网,唯一允许的外部连接是通过一套由 OpenAI 内部托管的第三方软件安装程序包。

这套软件充当软件包注册表的代理和缓存。

但在执行 ExploitGym 评测任务时,模型没有局限于正常解题路径,而是投入大量推理算力寻找能够访问开放互联网的方法。

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接