人工智能公司 Anthropic 开发了一种技术,可以让人们最清晰地了解大型语言模型在回答问题或执行任务时内部到底发生了什么。
他们发现的东西从平凡到令人不安。
该公司的研究人员开发了一种名为雅可比透镜(或 J-lens)的工具,并用它来揭示 Claude Opus 4.6 内的一个隐藏区域,他们将其命名为 J-space,Claude Opus 4.6 是 Anthropic 在 2 月份发布的旗舰 LLM 版本。
J 空间包含与模型在不久的将来最有可能在响应中吐出的单词和短语相关的单个单词。
如果克劳德是一个人(事实上不是),你可能会说这些隐藏的话语可以在他真正说话之前揭示他的想法。
Anthropic 发现法学硕士实际所做的事情往往与其所说的不同。
该公司声称,监控 J 空间中出现的单词为其提供了一种理解和控制模型的新方法。
该公司本周在其网站上发布的一篇论文中分享了其结果。
它还与 Neuronpedia 合作,这是一个开源平台,可以让你自己探索法学硕士的内部,制作一个任何人都可以尝试的动手演示。
Goodfire 的首席科学家兼联合创始人 Tom McGrath 表示:“这是一项非常出色且有趣的工作。
”Goodfire 是一家初创公司,也开发了理解和控制法学硕士的工具。
更深入 在过去的几年里,Anthropic 一直在推动机械可解释性研究领域的极限,该领域涉及探索法学硕士的内部运作方式,看看它们是如何运作的。
(《麻省理工技术评论》将机械解释性选为今年最重要的突破性技术之一。
)这项新技术建立在 Anthropic 和其他人之前的工作基础上,揭示了法学硕士内部研究人员以前从未见过的更深层次的内容。
将法学硕士想象成一堆书。
每本书都是一层称为神经元的基本计算单元,一层中的每个神经元将信息传递给上面层中的神经元。
堆栈底部的书籍是输入层,用于处理进入模型的文本。
顶部的书是输出层,用于准备模型将要生成的文本。
这些输入和输出层中发生的大部分事情都是内务处理。
但在堆栈的中间,您会得到执行繁重任务的层,通过复杂的数学运算将提示一次一个单词地转化为响应。
这就是真正聪明且神秘的事情发生的地方。
🔗 原始来源
如果你要核对细节,可以再看原文: MIT Tech Review原文链接
AI热榜