在有限预览之后,我们将全面推出 GPT‑5.6 系列型号:我们的新旗舰产品 Sol,以及适合日常工作的平衡型号 Terra,以及我们最具成本效益的型号 Luna。
GPT-5.6 Sol 为智能和效率设立了新标准,在编码、知识工作、网络安全和科学方面取得了最先进的结果,同时以更少的代币和更低的估计成本超越了以前的和竞争的前沿模型。
其结果是每美元的性能更强:以相同的支出完成更成功的工作,或者以更低的总成本获得类似的结果。
我们还引入了一种加速最苛刻工作的新方法:ultra 是我们最高能力的设置,可跨并行工作流协调多个代理,以更快地完成复杂任务。
更强的计算机使用和设计判断能力使 GPT‑5.6 Sol 成为我们迄今为止最出色的合作者,帮助它检查、完善和提供即用型结果。
我们训练 GPT-5.6 是为了从每个代币中获得更多有用的工作。
在 Agents’ Last Exam(在新窗口中打开)中,对跨 55 个领域的长期运行的专业工作流程进行了评估,GPT-5.6 Sol 创下了 53.6 分的新高,比 Claude Fable 5(自适应推理)高出 13.1 分。
即使在中等推理水平下,它也比《神鬼寓言 5》高出 11.4 个百分点,而成本约为预估成本的四分之一。
这种效率延伸到了更小的模型,这对于使智能更加丰富和经济实惠至关重要:GPT-5.6 Terra 和 GPT-5.6 Luna 的性能优于《神鬼寓言 5》,成本约为《神鬼寓言 5》的十六分之一。
在人工智能分析智能指数(在新窗口中打开)(涵盖代理工作、编码、科学推理和一般能力的广泛智能衡量指标)中,具有最大推理能力的 GPT-5.6 Sol 与《神鬼寓言 5》相差仅一分,同时完成任务的时间缩短了 61%,成本大约是估计成本的一半。
GPT-5.6 推出了迄今为止最强大的保护措施,旨在抵御确定的和适应性的滥用,而不会广泛限制合法工作。
在全面上市之前,我们将人类红队与大规模自动化测试相结合,对模型和防护措施进行了迄今为止最广泛的评估。
在预览期间,我们与专家组织和值得信赖的合作伙伴密切合作,在更广泛的发布之前对防御进行压力测试并加强保障措施。
由此产生的系统将保护层训练到模型中,并根据信任和风险进行实时检查、监控和访问校准。
GPT-5.6 Sol 是我们迄今为止最好的编码模型。
在人工分析编码代理指数上,具有最大推理能力的 GPT-5.6 Sol 将最新技术水平设定为 80,比《神鬼寓言 5》高出 2.8 个点,同时使用不到一半的输出令牌,花费了不到一半的时间,成本降低了约三分之一。
这一优势遍及整个系列:Terra 的性能略高于 Fable 5,而 Luna 的性能优于 Opus 4.8;每个都花费大约三分之一的时间,大约一半的输出代币,以及大约四分之一的估计成本。
它还在 Terminal‑Bench 2.1 和 DeepSWE 上设置了新的最先进的结果,这些结果在真实代码库中测试复杂的命令行工作流程和长期工程。
GPT-5.6 可以编写和运行轻量级程序来协调工具、处理中间结果、监控进度并在工作展开时选择下一步行动。
这使得需要大量工具的任务能够以更少的令牌、更少的模型往返和更少的指导来推进。
响应 API 中的编程工具调用(opens in a new window)无需开发人员编写每个步骤的脚本或将每个工具响应传递回模型,而是可以过滤大量中间数据,仅保留重要数据,并在此过程中调整其工作流程。
对于需要投入更多时间和计算的问题,GPT-5.6 可以超越这种高效的默认设置。
max 为 GPT-5.6 提供了比 xhigh 更多的时间来推理和探索替代方案、运行检查和修改其方法。
ultra 更进一步,默认情况下并行协调四个代理,用更高的代币使用量来换取更强大的结果,并在要求较高的任务上更快地获得结果。
下图比较了 BrowseComp、SEC-Bench Pro 和 Terminal-Bench 2.1 中 ultra 的默认四代理设置与单代理基线; BrowseComp 和 SEC-Bench Pro 还显示 16 个代理配置。
在所有三个评估中,添加并行代理会将分数延迟边界向上和向左移动,从而在更短的时间内达到更强的结果。
在 API 中,开发人员可以使用 Responses API 中的多代理测试版构建超类似的体验。
GPT-5.6 在设计判断方面发生了重大变化。
仅通过高层指导,GPT-5.6 就能创建高雅、符合人体工程学且功能齐全的界面。
其更强大的计算机使用功能使其能够检查和完善渲染结果,而不仅仅是生成底层代码或内容,因此它可以捕获视觉和功能问题,并在将工作交回之前进行最后的润色。
GPT-5.6 的前端功能还可将自然语言请求转化为 ChatGPT Work 中精美的交互式解释和可视化。
GPT-5.6 为专业任务提供更好的结果。
它从文档和日常工作流程(例如 Slack、Notion、Microsoft 365 和 Google Drive)中获取混乱的上下文,并将其转换为专家级的可共享工件。
🔗 原始来源
如果你要核对细节,可以再看原文: Hacker News AI原文链接
AI热榜