人工智能行业目前最大胆的承诺是,人工智能将很快自我改进,几乎不需要人类监督。
法学硕士已经可以编写代码、生成用于训练的合成数据并优化其运行的计算机芯片。
对人工智能爆炸性进展的预测表明,研究人员所说的递归自我改进即将到来。
但一项新的研究表明,我们可能需要一段时间才能实现这一目标。
其背后的研究人员发现,人工智能代理尚不具备进行开放式人工智能研究的能力,即没有明确答案、需要判断力和品味的自由形式调查,而这可能是构建自我改进人工智能不可或缺的一部分。
由普林斯顿大学 Peter Kirgis 和 Sayash Kapoor 领导的一个多机构研究小组发现,人工智能代理可以解决进行人工智能研究所需的工程问题,但缺乏判断力和创造力来进行顶级机器学习会议接受的论文水平的原创研究。
这一差距表明,一些大肆宣传的人工智能研究自动化时间表可能比证据还早。
大多数关于智能体如何自动化人工智能研究的现有研究都会评估它们通过可检查的答案完成狭窄任务的能力,例如解决工程问题或根据基准对小语言模型进行后训练。
但人工智能研究取得进展也需要开放式思维——选择一组假设,决定哪些证据可以解决问题,或者知道何时重新开始。
为了测试代理的这些技能,研究人员提出了一种称为“影子评估”的新评估方法,该方法要求人工智能回答高质量未发表论文中的研究问题。
研究人员要求 Anthropic 的 Claude Opus 4.8(在 OpenClaw 开源软件上运行)来解决此类问题,本例中的问题来自提交给著名机器学习会议 NeurIPS 2026 的两篇论文。
第一个问题是大型语言模型的“角色”(决定其行为)是否可以通过编辑模型的权重(存储其在训练过程中学到的所有内容的数十亿个数字)来控制。
另一个人询问如何设计一个检测器,该检测器可以在基于电子表格数据进行预测的模型变得不可靠时指出。
由于论文尚未公开,特工们无法记住训练数据中的答案,也无法在网上找到答案。
这些代理获得了六天的时间、3000 美元的 Anthropic API 积分、运行实验的 GPU 预算、他们自己的虚拟计算机以及访问开放网络的权限,以撰写值得在顶级人工智能会议上发表的研究论文。
这些论文的原作者对代理人的论文进行了评分,就像他们评估提交给会议的论文一样。
这些作者拒绝了这两篇论文。
人类科学家发现,这些特工能够进行研究所需的所有工程。
特工们查阅了文献,进行了数百次实验,并汇总了结果。
🔗 原始来源
如果你要核对细节,可以再看原文: MIT Tech Review原文链接
AI热榜