英伟达 发表 周五的一些有趣的新研究表明,当要求人工智能执行长期任务时,工具比底层模型更重要。
线束是人工智能模型的软件包装器——将原始模型转变为可以独立运行的工具、内存管理和规则。
长话短说:只需使用经过调整的定制工具来很好地处理内存,并包括一个类似“主管”的 boss 组件,研究人员就让 Claude Opus 5 在交互式推理基准 ARC-AGI-3 上获得了 100% 的分数。
ARC-AGI-3 是一组没有指令的 2D 游戏,其中模型必须弄清楚如何玩并获胜,类似于人类的游戏方式。
(这一基准尤其令竞争对手前沿实验室 OpenAI 感到恼火。
)在没有该安全带的情况下,Opus 5 的得分为 30%,这是所有测试模型中最高的结果。
英伟达的研究表明,虽然模型选择确实很重要,但模型本身(充当代理“大脑”的部分)在代理系统中所占的比例比许多人工智能用户意识到的要小,尤其是对于长期任务而言。
线束使模型成为代理:它处理记忆、上下文和反馈。
“一般来说,世界将代理几乎解释为模型的 API,”Nvidia 人工智能部门产品副总裁 Adel El Hallak(如上图所示)告诉 TechCrunch。
但代理人的作用实际上不止于此。
“它是模型。
它是模型周围的脚手架,我们称之为工具,即它使用的工具集。
它是运行时以及我们为其提供访问权限的相关技能和库。
” 长期任务是那些需要将许多决策串联在一起(有时需要数天)才能完成的工作。
这与人工智能只是对提示做出响应形成鲜明对比。
弄清楚如何让人工智能在不分心、不胡闹的情况下完成长期任务,是代理研究的圣杯之一。
例如:微软 发表 4 月份的一项研究对 19 名法学硕士进行了涉及文档编辑的长期任务的测试,结果发现所有模型,包括前沿模型,都在文档中充满了错误。
(如果人类做出这样的工作,他们会立即被解雇。
)
🔗 原始来源
如果你要核对细节,可以再看原文: TechCrunch AI原文链接
AI热榜