由 Rachel Gardner 于 2026 年 7 月 21 日星期二 - 14:54 提交 当公众对人工智能能够变得更好的时候,这里的研究人员已经解决了影响其发展的核心挑战之一。
该研究团队包括来自 NVIDIA 和 Flower Labs 的合作者,他们提出了一种新方法,让递归式自我改进 AI 代理能够持续改进自己(通过反复测试和增强自己的代码),而不会达到他们经常遇到的评估上限。
他们的方法还提出了一种削减开发此类人工智能代理所需的计算资源成本的方法。
虽然代理已经可以通过编辑自己的代码、测试变体并保持性能更好的更改来改进自己,但此过程通常受到固定评估器、基准测试或测试套件的限制。
一旦智能体了解了固定信号可以区分的所有内容,改进就会减慢或停滞。
团队成员 Alex Iacob 解释说:“自我改进的智能体只能在测试中取得好成绩。
”他是 Nic Lane 教授指导下的机器学习系统实验室的博士生。
“测试不仅衡量进展,还定义进展,因此测试的有效性成为代理无法逾越的上限。
” 现在,研究人员通过让自我改进代理和评估器一起进化来解决这个问题。
“我们不是根据固定测试来改进代理,而是让评估与代理一起发展,”亚历克斯补充道。
“随着经纪人的水平越来越高,评估的难度也越来越大,门槛也越来越高。
” 红皇后哥德尔机 Alex 是研究团队刚刚上传到 arXiv 的预印本论文的第一作者。
《红皇后哥德尔机:共同进化的智能体及其评估者》分享了他们工作的技术细节,以及在许多任务中使用该框架所取得的一些令人印象深刻的结果。
图:代理和评估者共同进步。
红皇后哥德尔机搜索人工智能代理的许多可能版本,同时还改进了判断这些代理的评估器。
在每个阶段,评估者保持固定,以便可以可靠地衡量进度。
在检查点,如果旧的评估器在可信的真实示例上表现更好,则更强大的评估器可以取代旧的评估器。
然后,旧评估器的分数将被删除,因此下一阶段将由新的、更严格的标准指导。
这创建了一个自我改进的循环,在这个循环中,代理和评估者共同改进,而系统仍然锚定于可靠的检查。
🔗 原始来源
如果你要核对细节,可以再看原文: Hacker News AI原文链接
AI热榜