据我们所知,人们相互交谈至少已经有十万年了。
一直以来,世界上只有一种东西可以完美流利地学习人类语言:人类的孩子。
现在有两个。
ChatGPT 发布短短四年后,我们中的许多人现在理所当然地认为我们可以与手机或电脑自然地交谈。
Claude、DeepSeek 和 OpenAI 等法学硕士的 GPT 模型足够流畅和灵活,足以令人信服地伪装成人类。
但透过计算幕布的背后,我们会发现一个问题:教计算机使用人类语言仍然需要大量的数据。
法学硕士可以轻松掌握比一个人在掌握母语过程中所经历的多十万倍的单词,并且比孩子们在他们一岁生日时通常开始掌握语言时可能听到的单词还要多。
“最近的进展令人惊叹,”斯坦福大学认知科学家迈克尔·弗兰克 (Michael C.
Frank) 谈到法学硕士时说道。
“但我们仍然需要烧毁一片森林,并搜集所有人类知识,才能重新创造这一在一年内发生在我们客厅里的里程碑。
” 儿童和机器之间的这种巨大鸿沟被称为数据效率差距。
它给认知科学家提出了一个诱人的问题,也给人工智能模型的架构师提出了挑战:孩子们如何仍然能够超越有史以来语言上最复杂的机器?
寻找答案对于人工智能研究和认知科学都至关重要。
在过去的十年里,语言模型大多是通过变得更大而变得更好。
Meta 的开放权重 LLM Llama 3.1 于两年前发布,在预训练中咀嚼了 15 万亿个令牌(类似单词的语言块)——这是训练模型的主要步骤,发生在针对特定任务(例如成为聊天机器人)进行微调之前。
乔治城大学认知科学家兼语言学家 Ethan Gotlieb Wilcox 表示,前沿模型可以使用 10 倍以上的数据进行预训练。
但可供训练的互联网资源有限,最终(也许早在 2030 年代)容易获取的数据可能会枯竭。
孩子们表明,用更少的钱学更多的东西是可能的。
少得多。
在语言丰富的家庭中长大的青春期前儿童可能听过大约一亿个单词的内容。
再加上识字能力,到 20 岁时,您的字数可能会增加到 3 亿字。
规模上的差异只能通过类比来真正体现。
“克劳德看到了整个城市在一代人的时间内将经历的语言数量,”威尔科克斯说。
如果你把用于训练现代法学硕士的所有单词打印在纸上,你可以制作一叠可以越过国际空间站的单词。
与此同时,人类青春期前的 1 亿个单词叠起来只有 20 米。
我们可以用比这少得多的钱凑合。
通过对孩子们的学习方式进行逆向工程,科学家们希望能够创建数据效率更高的人工智能模型,该模型可以用于从在视频上有效训练人工智能到创建为少数语言社区服务的聊天机器人等各个方面。
在机器模型中测试有关人类学习的假设也可以解决有关语言和儿童思维发展的持久问题。
我们生来就有语言本能吗?
或者,即使在原则上,孩子有可能纯粹从经验中学习语言吗?
我们处理语言的方式是我们生物学的一个怪癖,还是至少其中一些反映了如何使用和学习语言的普遍限制?
基本要素
🔗 原始来源
如果你要核对细节,可以再看原文: MIT Tech Review原文链接
AI热榜