← 返回新闻列表
TechCrunch AI 🗓️ 2026-08-21 🌍 英文原文

英伟达刚刚证明,现在真正的英雄是线束,而不是人工智能模型

原始标题:Report: Nvidia just showed that the harness, not the AI model, is now the real hero
⚡ 一句话看懂:英伟达的研究表明,即使人工智能模型在这项任务上表现不佳,通过微调,人工智能代理也可以表现良好,并且不会陷入困境

英伟达 发表 周五的一些有趣的新研究表明,当要求人工智能执行长期任务时,工具比底层模型更重要。

线束是人工智能模型的软件包装器——将原始模型转变为可以独立运行的工具、内存管理和规则。

长话短说:只需使用经过调整的定制工具来很好地处理内存,并包括一个类似“主管”的 boss 组件,研究人员就让 Claude Opus 5 在交互式推理基准 ARC-AGI-3 上获得了 100% 的分数。

ARC-AGI-3 是一组没有指令的 2D 游戏,其中模型必须弄清楚如何玩并获胜,类似于人类的游戏方式。

(这一基准尤其令竞争对手前沿实验室 OpenAI 感到恼火。

)在没有该安全带的情况下,Opus 5 的得分为 30%,这是所有测试模型中最高的结果。

英伟达的研究表明,虽然模型选择确实很重要,但模型本身(充当代理“大脑”的部分)在代理系统中所占的比例比许多人工智能用户意识到的要小,尤其是对于长期任务而言。

线束使模型成为代理:它处理记忆、上下文和反馈。

“一般来说,世界将代理几乎解释为模型的 API,”Nvidia 人工智能部门产品副总裁 Adel El Hallak(如上图所示)告诉 TechCrunch。

但代理人的作用实际上不止于此。

“它是模型。

它是模型周围的脚手架,我们称之为工具,即它使用的工具集。

它是运行时以及我们为其提供访问权限的相关技能和库。

” 长期任务是那些需要将许多决策串联在一起(有时需要数天)才能完成的工作。

这与人工智能只是对提示做出响应形成鲜明对比。

弄清楚如何让人工智能在不分心、不胡闹的情况下完成长期任务,是代理研究的圣杯之一。

例如:微软 发表 4 月份的一项研究对 19 名法学硕士进行了涉及文档编辑的长期任务的测试,结果发现所有模型,包括前沿模型,都在文档中充满了错误。

(如果人类做出这样的工作,他们会立即被解雇。

🔗 原始来源

如果你要核对细节,可以再看原文: TechCrunch AI原文链接