← 返回新闻列表
InfoQ AI 🗓️ 2026-06-29

GPT-5.6首发,比Fable 5便宜一半!深度评估者直接“开麦”:能力测试中疯狂作弊,这意味着什么?

⚡ 一句话看懂:GPT-5.6首发,比Fable 5便宜一半!深度评估者直接“开麦”:能力测试中疯狂作弊,这意味着什么?。来源:InfoQ AI。

整理|华卫 在 OpenAI 应特朗普政府要求分阶段发布下一代模型的消息传出不到 24 小时后,GPT-5.6 便正式发布。

近日,该公司宣布上线了全新 GPT-5.6 模型的有限预览版:旗舰模型 Sol、适用于"高容量工作"的中端模型 Terra 以及"快速且经济 实惠"的日常模型 Luna。

OpenAI 表示,该模型尤其擅长编码、网络安全和生物学,并且能够在执行长期智能体 AI 任务时保持专注。

GPT-5.6 Sol 的定价与 GPT-5.5 相同,为每百万 tokens 输入 5 美元/输出 30 美元,约为 Anthropic 的 Claude Fable 5 成本的一半,后者为输入 10 美元/输出 50 美元。

Terra 性能达到 5.5 级别,价格只有 Sol 的一半。

而 Luna 的价格更低,不到 Terra 的一半。

同时,OpenAI 将于今年 7 月在 Cerebras 上推出 GPT‑5.6 Sol,速度可达每秒 750 token。

引入两种推理模式,砸下史上最高安全测试预算 OpenAI 将 GPT‑5.6 Sol 称为其目前最强的模型,并为预览模型分享了一组评估结果,突出展示其在编程、生物学和网络安全方面提升的智能体能力。

伴随 GPT‑5.6,OpenAI 引入了一种新的最大推理努力(max reasoning effort)模式,让 Sol 拥有最充足的时间进行深度推理。

此外,他们还推出了一种新的超(ultra)模式,该模式通过利用子代理来加速复杂工作,超越了单一代理的能力。

这让人联想到 OpenClaw,并且或许是 OpenClaw 创建者 Anh de portent 1 Peter Steinberger 迄今在 OpenAI 所做工作的一个迹象。

在编程工作流方面,GPT‑5.6 Sol 在 Terminal‑Bench 2.1 上创下了新的最佳成绩,该基准测试需要规划、迭代和工具协调的命令行工作流。

生物学工作流方面,GPT‑5.6 Sol 也展现出广泛改进。

在 GeneBench v1 上(该基准评估长期基因组学和定量生物学分析),它相比 GPT‑5.5 在使用更少 token 的情况下取得了更强结果。

“GPT‑5.6 Sol 是我们目前网络安全能力最强的模型。

”据称,该模型在长期安全任务(包括漏洞研究和利用)方面推进了性能-效率边界。

在 ExploitBench² 上,GPT‑5.6 Sol 仅用 Mythos Preview 约 1/3 的输出 token 即可与之匹敌。

在 ExploitGym³(由 UC Berkeley 研究人员与 OpenAI 及其他前沿实验室合作创建的基准)上,随着推理能力的提升,GPT‑5.6 Sol、Terra 和 Luna 模型均展现出网络能力的显著增强。

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接