← 返回新闻列表
Hacker News AI 🗓️ 2026-08-17 🌍 英文原文

GPT 5.6 Sol是OpenAI有史以来发布的最好的“视觉”模型

原始标题:Analysis: GPT 5.6 Sol is the best "vision" model OpenAI ever released
⚡ 一句话看懂:文章网址:https://blog.roboflow.com/openai-gpt-5-6/ 评论网址:https://…

上周,OpenAI 宣布了 GPT-5.6 系列,推出了 Sol、Terra 和 Luna 模型。

在发布过程中,团队主要关注计算机的使用,展示了能够导航和操作桌面应用程序的模型。

OpenAI 强调了 UI 代理和详细的 3D 可视化,但两者都依赖于更强的视觉理解。

为了测量他们的视觉能力,我们通过即将推出的 VLM 基准测试来运行模型,我们计划在未来几周内发布该基准测试。

该基准测试涵盖常见的视觉任务,包括检测、计数、OCR 和数据提取。

在这篇文章中,我们将仔细研究 GPT-5.6 在每个方面的表现。

Sol 显然是 OpenAI 迄今为止发布的最好的视觉模型。

这种跳跃在物体检测和计数中尤其明显,其中 GPT-5.5 远远落后于最强的 VLM。

Terra 和 Luna 不如 Sol 强大,但两者都比 GPT-5.5 取得了有意义的进步。

物体检测 检测是 GPT-5.6 显示最明显跳跃的地方。

GPT-5.5 在我们的基准测试中得分为 13.8 mAP@50,而 Sol 达到 46.2。

Terra 和 Luna 紧随其后,分别为 44.7 和 43.3,移动物体检测从主要弱点变成了实用能力。

文档布局检测是 GPT-5.6 最明显的优势之一。

Sol 很好地处理了标题、段落、表格、图像和签名。

许多文档工作流程首先在 OCR 或数据提取开始之前定位页面的相关部分。

GPT-5.6 在密集场景上也表现良好。

药丸和鸡蛋示例包含许多紧密排列在一起的相似物体,这是基于 VLM 的检测的常见弱点。

与传统检测器不同,VLM 生成每个类标签和一组坐标作为文本。

随着对象数量的增加,响应时间会变长,丢失对象、重复对象或坐标错误的风险也会增加。

尽管如此,Sol 仍然检测到了两个场景中的大多数物体。

为了获得最佳检测结果,请提示 GPT-5.6 模型返回图像像素中的绝对 XYXY 坐标。

这与 Gemini 3.5 Flash 不同,Gemini 3.5 Flash 在 YXYX 坐标标准化为 0-1000 范围时表现最佳。

在我们的基准测试中,使用错误的坐标格式使 GPT-5.6 检测性能降低了大约 15 个 mAP 点。

在少数情况下,GPT-5.6 Sol 在图像中看似随机的部分返回了方框。

许多与事实真相没有重叠,或几乎没有重叠。

这些盒子常常形成不自然的布局,例如直行或均匀间隔的组,而不是与可见对象相匹配。

我们与 OpenAI 分享了这些示例。

他们的团队证实,Sol 在 2,000 x 2,000 像素左右或更大的图像上变得不太稳定,特别是在推理工作量较低的情况下。

更高的推理工作可以提高稳定性,但也会增加令牌使用、延迟和成本。

在将大图像发送到 OpenAI API 之前调整大小或裁剪大图像是最实用的解决方法。

🔗 原始来源

如果你要核对细节,可以再看原文: Hacker News AI原文链接