整理 | 华卫 近日,Anthropic 发布了一篇重磅研究论文,指出其 Claude 语言模型在训练过程中自发形成了一个小型“工作空间”,模型会在其中存放和处理想法,而无需将其表达为语言输出。
关键的是,其内部结构竟然与人类有意识地获取和处理思想的方式高度相似。
该公司表示,这一发现已经开始重塑其监测 AI 系统安全风险的方式。
在关于机器是否可能具备某种“心智”的科学争论愈发激烈的背景下,这一研究尤为引人关注。
现在,Anthropic 已开源相关代码,并与 Neuronpedia 合作推出了交互式演示,同时邀请了参与“全局神经工作空间模型”研究的神经科学家 Stanislas Dehaene 和 Lionel Naccache,以及 Eleos AI Research 和 Rethink Priorities 的 AI 福利研究人员参与评议。
开源仓库: https://github.com/anthropics/jacobian-lens 演示链接: http://neuronpedia.org/jlens 新视角:AI“未说出口”的那些想法 这项由 16 位作者共同完成的研究,题为《可言说表征在语言模型中形成全局工作空间》(Verbalizable Representations Form a Global Workspace in Language Models)。
论文描述,Anthropic 研究人员通过一种全新的数学方法深入探查 Claude 的神经网络,发现了他们称之为“J 空间”(J-space)的结构,这是一个规模较小但“特权化”的内部活动区域,模型在其中存储可以被报告、推理并主动调用的概念;其周围则是一个庞大的自动化处理“海洋”,这些过程模型既无法直接访问,也无法表达。
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜