← 返回新闻列表
Hacker News AI 🗓️ 2026-07-12 🌍 英文原文

将生产 AI 代理迁移到 GPT-5.6:速度提高 2.2 倍,成本降低 27%

原始标题:Latest: Migrating a production AI agent to GPT-5.6: 2.2x faster, 27% cheaper
⚡ 一句话看懂:将生产 AI 代理迁移到 GPT-5.6:速度提高 2.2 倍,成本降低 27%。来源:Hacker News AI

截至今天,Ploy 的代理运行在 GPT-5.6 Sol 上,这是今天早上发布的 OpenAI 模型系列的旗舰层。

鉴于我们对质量的要求极高,几个月来我们一直找不到能够挑战 Claude Opus 的模型。

GPT 5.6 Sol 改变了这种情况。

在与 Claude Opus 进行正面交锋后,我们将 GPT 5.6 Sol 设为为每个 Ploy 工作区提供支持的默认模型。

这是一个比听起来更大的转变。

Ploy 的代理建立和编辑真实的营销网站。

它规划一个页面,读取代码库,编写组件,生成图像,截取自己的工作,并决定何时完成。

该工作描述为模型设定了非常高的标准,我们根据它测试每个前沿版本。

在四个月的时间里,Opus 占据了默认位置(首先是 Opus 4.7,然后是 4.8),我们测试的任何东西都无法击败它。

GPT-5.6 是第一个这样做的模型。

并不是说第一次评估运行是完美的。

它有真实的故障模式,我们将向您展示。

但它做得非常好,而且承诺是直接而具体的:在不到一半的挂钟时间内完成构建,成本降低 27%,在已完成工作上的得分等于或高于我们现有的得分。

这样的数字需要一个真正的迁移工作才能建立模型。

尽管使用 Vercel’s 人工智能软件开发工具包 ,一个通用的 LLM SDK,从 Claude Opus 4.8 切换到 GPT 5.6 Sol 需要发现,一次一次评估失败,我们认为的“模型”是特定于提供者的行为,我们的整个堆栈已经悄然专门围绕:它如何填充工具参数,它的提示缓存如何工作,它如何在轮流之间重放自己的推理。

这就是需要做的事情:修复评估工具,然后修复工具模式,然后缓存,然后推理重放。

第 0 步:在信任单个号码之前修复您的安全带 我们的评估套件针对真实的固定工作空间运行真实的代理。

数百个案例,从“从头开始构建主页”到“此克隆请求执行是否安全。

”构建案例由视觉法官对参考设计运行二进制检查进行评分,十个是/否问题,例如 – 英雄是一个全出血的摄影场景 –

🔗 原始来源

如果你要核对细节,可以再看原文: Hacker News AI原文链接