更大的模型不是出路 2026 年 6 月 18 日 主要人工智能实验室正在发生转变,他们对无休止的参数计数和训练数据扩展越来越持怀疑态度。
当《克劳德寓言5》上映三天后,美国政府限制了这一范式,这标志着美国首个出于国家安全原因的人工智能禁令。
世界上最大的模型之一被禁止,因为一次越狱风险太大。
越大越好 上述情况几乎在所有情况下都是正确的。
世界上最大的模型显然在人工智能分析指数上得分最高。
然而,Z.ai 最新的 GLM-5.2(753B 参数,大约 40B 活跃)仅比 GPT-5.5 差 4 分,比 Fable 5 差 9 点。
Opus 4.8 和 GPT-5.5 是专有的,保守估计在 1-2T 参数范围内。
如果开放权重(麻省理工学院许可)法学硕士可以如此接近估计大 1.5 到 2 倍的封闭权重模型,那么很明显,实际智力已显着趋于稳定。
并非越大越好 事实证明,当一个模型接受大量高度真实和非理论数据的训练时,它学会了总是有答案。
DeepSeek V4 Pro(1.6T 参数,49B 活跃,44 AA 智能指数得分)在 AA-Omniscience 基准上的幻觉得分达到了可笑的 94%,这意味着对于它无法弄清楚的问题,它只在大约 6% 的时间里表示它不知道,其余的时候它自信地幻出了答案。
GLM-5.2 的幻觉率为 28%,Opus 4.8 为 36%,Fable 5 为 48%,GPT-5.5 为 86%。
对于如此庞大、流行的模型来说,这似乎非常粗糙。
让我们用一个相对复杂的 Python 问题来测试它,该问题具有明显的架构缺陷。
1 DeepSeek V4 Pro 使用了几乎 10 倍的推理标记,但却产生了一个确信不正确的响应。
另一方面,GLM-5.2 仅用了 12 秒和大约 800 个推理标记就认识到单线程任务在不产生或利用系统轮询的情况下执行多路复用 I/O 在技术上是不可能的。
(对于非技术人员来说,这就像要求送货司机在不停车的情况下同时在 3 个房子投递包裹。
) GPT-5.5 和 DeepSeek V4 Pro 是两个最清晰的幻觉领导者,尽管它们绝对巨大。
由于规模巨大,他们根本不学会如何说“我不知道”或识别复杂的逻辑和技术谬误。
虽然数万亿参数模型在纸面上总是会击败轻量级消费者模型(至少在今天),但这些大型模型的商品化正在模糊基准性能与现实世界的真实性和准确性之间的界限。
🔗 原始来源
如果你要核对细节,可以再看原文: Hacker News AI原文链接
AI热榜