用其他人工智能模型训练人工智能模型已经成为 Neolabs 非常流行的目标——现在,Anthropic 研究员项目的一位研究人员让我们提前了解了它在实践中的情况。
周五,Anthropic 发表了一篇新论文,题为“ 自动化研究人员可以可靠地减少对齐失败 ”,详细介绍了人工智能系统如何可靠地提高模型在一组对齐基准上的性能。
当针对特定的失调行为给出 10 个基准时,自动化系统能够提高每一项的性能,而不会降低整体性能。
该系统由人类研究员陈月汉领导,复制了许多传统的研究方法。
每个自动化系统都会搜索可用文献,提出一种方法,并使用该方法训练模型 30 分钟,通过多次迭代逐渐提高基准。
有效的方法被保留,无效的方法被丢弃,使系统能够快速、大规模地运行。
“总的来说,这些结果提供了早期证据,表明训练后自动对齐可能在短期内变得实用,”论文中写道。
该论文是朝着 递归自我完善 许多人认为这是人工智能进步的下一个重要步骤。
如果模型能够改进自己的对齐训练,那么它们就有可能更广泛地改进训练实践——到那时,人类人工智能研究人员可能很快就会被淘汰。
这篇论文并不羞于讨论这个想法,明确地将自动对齐研究人员(AAR)与人类的同类进行了比较。
论文中写道:“最好的 AAR 方法平均在六个小时内就击败了经验丰富的人类提出的方法。
” “人类指导的研究方向不会带来更强的表现。
”
🔗 原始来源
如果你要核对细节,可以再看原文: TechCrunch AI原文链接
AI热榜