作者 | 邱晓芬 编辑 | 袁斯来 过去半年,国内具身智能赛道经历了一场静悄悄的重心转移:聚光灯从硬件本体的“自由度竞赛”,逐渐移向决定机器人智能上限的深水区。
只是,当行业反复讨论“机器人能否通过暴力堆数据复刻大语言模型 ScalingLaw”时,上海创智学院副教授、智元机器人首席科学家罗剑岚,给出了一个并不随大流的判断:具身智能不能简单照搬大语言模型的发展路径。
罗剑岚的表达风格极具辨识度。
他习惯在中英文专业术语之间快速切换,逻辑推进密集,很少给出模糊的折中答案。
相比停留在“数据、模型、Infra哪个更重要”的单点争论上,他更倾向于直接指出问题本身:当前具身智能的核心矛盾,不是某一个环节的单独突破,而是这些环节能否在真实部署中形成闭环。
这种判断来自他横跨学术研究与产业落地的经历。
作为曾经的伯克利博士,他师从具身智能领域奠基性人物Sergey Levine(谢尔盖·列文)。
毕业后,他曾任Google X与DeepMind研究科学家,14个月前,他回国并加入创智学院和「智元机器人」。
在他看来,目前行业里相当一部分所谓“具身基础模型”的训练方式,并不是真正意义上的预训练,更接近中训练(Mid-training)或微调(Fine-tuning)。
原因也很现实:当前高质量真机交互数据仍然稀缺,尤其是覆盖多场景、多任务、多本体,并且包含失败、纠错和长尾交互的数据,远不足以支撑类似大语言模型那样的大规模预训练。
这也造成了一个现象:在真机交互数据不足的阶段,行业里不少团队会选择在已有开源模型底座之上,叠加高质量遥操数据,在特定任务上进行对齐或微调。
🔗 原始来源
如果你要核对细节,可以再看原文: 36氪原文链接
AI热榜