SpaceXAI的Grok 4.6在人工智能分析智能指数中得分61,与GPT-5.6 Sol并列前沿,以更低的成本实现出色的代理性能 在发布仅一个多月后,Grok 4.6 的智能指数就比 Grok 4.5 提高了 5 分,比 Grok 4.3 提高了 23 分。
这使得 SpaceXAI 与 OpenAI 一起重返智能前沿,仅次于 Anthropic。
要点: ➤ Grok 4.6 跻身人工智能分析指数前沿:得分为 61,与 GPT-5.6 Sol(最大值)一致,落后于 Claude Opus 5(最大值,63)和 Claude Fable 5(带回退的最大值,62),略高于 Kimi K3 ➤ 强大的代理性能:Grok 4.6 的 GDPval-AA v2 Elo 达到 1753,仅落后于 Claude Opus 5,并且与 Claude Fable 5 和 Qwen3.8 Max 具有重叠的置信区间。
它在 𝜏³-Banking 上得分为 50.7%,与 Qwen3.8 Max(51.3%)一起跻身前两名,在 Terminal-Bench v2.1 上得分为 88.4%,与领先型号一致 ➤ 以更低的成本提供前沿级智能:总体定价与 Grok 4.5 持平,为每 100 万个输入/输出代币 2 美元/6 美元,比 Claude Opus 5(5 美元/25 美元)和 GPT-5.6 Sol(5 美元/30 美元)低 60% 以上。
每个任务的成本为 0.84 美元,与智力稍高的 Kimi K3 相同,处于智力与每个任务成本的帕累托前沿 ➤ Grok 4.6 位于 AA-Briefcase 上的 Fable 5 层,AA-Briefcase 是我们长期代理知识工作任务的私人基准,Elo 为 1577 - 落后于 Claude Opus 5 系列。
它的回合效率非常高,平均需要约 53 个回合和约 0.5B 个输入令牌来完成任务,而 Claude Opus 5(最大)则需要约 103 个回合和约 2.0B 个输入令牌 其他模型详细信息:➤ 500k 令牌的上下文窗口(与 Grok 4.5 相比没有变化) ➤ 每 100 万个输入/输出代币定价为 2 美元/6 美元;缓存命中折扣至每 100 万代币 0.5 美元,比 Grok 4.5 的每 100 万代币 0.3 美元的缓存命中有所增加 代理表现 Grok 4.6 的最强结果是在代理工作而不是静态推理上。
在我们对现实世界代理知识工作的主要衡量标准 GDPval-AA v2 上,它的 Elo 得分为 1753 - 仅落后于 Claude Opus 5,并且在给定重叠置信区间的情况下,在统计上与 Claude Fable 5 和 Qwen3.8 Max 没有区别。
🔗 原始来源
如果你要核对细节,可以再看原文: Hacker News AI原文链接
AI热榜