← 返回新闻列表
MIT Tech Review 🗓️ 2026-08-26 🌍 英文原文

人工智能模型搞砸了这些智力测试。你还能过得更好吗?

原始标题:Update: AI models flub these intelligence tests. Can you fare any better?
⚡ 一句话看懂:从一开始,谜题和游戏就一直是人工智能开发的核心。正如我们人类喜欢通过填字游戏或逻辑谜题来测试我们的智力一样,开发人员也可…

从一开始,谜题和游戏就一直是人工智能开发的核心。

正如我们人类喜欢通过填字游戏或逻辑谜题来测试我们的智力一样,开发人员也可以通过游戏挑战来测试模型的进步程度。

“机器学习”一词因 IBM 计算机科学家 Arthur Samuel 1959 年发表的一篇关于学习下跳棋算法的文章而流行起来。

国际象棋和中国棋盘游戏围棋也是著名的人工智能试验场。

纯粹从其令人费解的技能来判断,人工智能正在快速进步。

2024 年末,哥伦比亚大学的一组科学家表明,即使是最好的模型也只能解出臭名昭著的《纽约时报》连接谜题的 18%;到 2025 年初,一些模型每次都能近乎完美地解决这些问题。

但谜题的作用不仅仅是凸显人工智能能力的不可阻挡的进步。

了解模型在哪些方面成功和失败,以及我们人类在哪些方面仍然击败了它们,可以为了解该技术的优势和劣势提供一个有用的窗口。

尽管取得了进步,今天的模型仍然很笨拙:经典谜语的微妙变化常常会让它们出错,而视觉谜题是一个特别的弱点。

在这里,你将有机会在曾经难倒模型的谜题上测试你的智慧。

有些对你来说可能和对人工智能一样棘手;其他的则非常简单,以至于会让你怀疑人工智能是否真的智能。

每一项都强调了机器和人类认知的至少一种差异。

如果你在测试中取得了好成绩,你就证明了你可以战胜人工智能——至少现在是这样。

空间推理 让我们从人类拥有巨大优势的领域开始:空间推理。

如果您曾经参加过智商测试,那么您可能遇到了心理旋转问题。

这些谜题要求您确定不同的图像是否从不同的角度代表相同的物体。

尽管当今的语言模型通常具有分析视觉输入的能力,但它们在解决这些难题上仍然表现不佳。

尽管人们都在谈论世界模型如何帮助人工智能理解物理环境,但法学硕士似乎仍然无法像建筑师和机械工程师等空间思考者那样操纵 3D 对象。

心理旋转 说明:选择显示提示中的物体的答案,但从不同的角度。

在每种情况下,只有一个正确答案!

记忆力和适应性 前沿法学硕士拥有非凡的记忆力;他们在训练期间接触到了大量的事实,并且能够忠实地背诵其中许多事实。

这是在琐事上胜过人类的一项资产,但也可能是一种负担。

当一个谜题与模型在训练过程中看到的谜题非常相似时,模型可能会突然发现关键差异并用它记住的内容做出反应。

🔗 原始来源

如果你要核对细节,可以再看原文: MIT Tech Review原文链接