← 返回新闻列表
Hacker News AI 🗓️ 2026-06-17 🌍 英文原文

GLM-5.2 是人工分析领域新的领先开放权重模型

原始标题:Update: GLM-5.2 is the new leading open weights model on Artificial Analysis
⚡ 一句话看懂:GLM-5.2 是人工分析领域新的领先开放权重模型。来源:Hacker News AI

GLM-5.2 是人工智能指数上新的领先开放权重模型 Z ai 的 GLM-5.2 是人工智能分析智能指数得分 51 的新的领先开放权重模型,它位于智能与每任务成本的帕累托前沿 GLM-5.2 与 GLM-5.1 大小相同(总计 744B / 40B 活动参数),但在 Intelligence Index v4.1 上得分高出 11 分,领先于 MiniMax-M3 (44) 和 DeepSeek V4 Pro(最大值,44)。

在第一方 API 上,其定价与 GLM-5.1 一致,每 1M 输入/输出/缓存命中令牌 1.4 美元/4.4 美元/0.26 美元 主要结果: ➤ GLM-5.2 是 Intelligence Index v4.1 上领先的开放权重模型。

它以 51 分领先 MiniMax-M3(44)、DeepSeek V4 Pro(最大,44)和 Kimi K2.6(43) ➤ 大多数评估的改进,特别是科学推理:GLM-5.2 在大多数评估中都优于 GLM-5.1,其中以 CritPt(+16 点至 21%)和 HLE(+12 点至 40%)的科学推理为首,同时还有 AA-LCR(+9 点至 71%)、tau3 银行(+15 点至 27%)和 SciCode(+7 点至 50%)。

TerminalBench v2.1 也有所改进(+16 点至 78%),GPQA Diamond 增加 3 点至 89% ➤ GDPval-AA v2 上领先的开放权重模型,并与专有模型竞争:GLM-5.2 在 GDPval-AA v2 上得分 1524,领先于 MiniMax-M3 (1418) 和 DeepSeek V4 Pro(最高 1328)。

这一令人印象深刻的结果使 GLM-5.2 与包括 GPT-5.5(xhigh 推理)在内的专有模型保持一致。

GDPval-AA v2 建立在原始 GDPval-AA 的基础上,将 Elo 与人类表现的基线设置为 1000,引入前沿模型法官轮换小组,并将较长时间智能体轨迹的转弯限制从 100 提高到 250 ➤ GLM-5.2 比其他领先的开放权重模型在每个任务中使用更多的输出标记:该模型在每个智能指数任务中使用 43k 输出标记,高于 GLM-5.1 (26k) 及以上 MiniMax-M3 (24k)、Kimi K2.6 (35k) 和 DeepSeek V4 Pro(最大值,37k) ➤ 在智能与每任务成本帕累托前沿上:GLM-5.2 位于智能与每任务成本图表的帕累托前沿,在其智能级别的模型中每任务成本最低。

GLM-5.2 每项任务的成本约为 0.46 美元,而 GLM-5.1(0.25 美元)、Kimi K2.6(0.31 美元)、MiniMax-M3(0.18 美元)和 DeepSeek V4 Pro(最高 0.05 美元) 其他型号详细信息:

🔗 原始来源

如果你要核对细节,可以再看原文: Hacker News AI原文链接