作者 | 华卫 策划 | 蔡芳芳 两年时间,大语言模型横扫全球。
而机器人发展了几十年,依然难以走出实验室。
问题可能出在,机器人还没有属于自己的“数据互联网”。
对 ChatGPT 来说,其核心架构 Transformer 是 Google 在 2017 年提出的;OpenAI 做对的,是另一件事:把数据规模推到前所未有的量级,核心要素就是海量、低成本、易获取的互联网文本数据。
仅有规模还不够,OpenAI 在 ChatGPT 训练过程中设计了一套数据反馈链路策略 RLHF。
当模型参数足够大、有效数据足够多,智能就“涌现”了。
机器人训练要实现类似的突破,或许也需要一场精妙的数据策略:不仅要有足够的数据,精度也得够。
然而,在当前具身智能领域中,虽然已经出现大量训练场和数据采集中心,但真正可用于训练的数据规模仍十分有限。
与大模型能依赖互联网公开数据不同,机器人数据从一开始就很“贵”。
传统机器人训练要么需要请专家写代码,要么需要专业的遥操作设备、光学动捕系统、力矩传感器来采集数据,这些设备加在一起,少则几十万,多则上百万。
更麻烦的是,每家厂商的机械臂,电机、力矩、尺寸都不一样,在 A 机器人上采的数据,到 B 机器人上可能完全不能用。
每一台机器人本体,都是一座“孤岛”。
仿真数据成本低,但离现实的“鸿沟”不小:在仿真环境里练得很好机器人,放到现实世界可能就失灵了。
2024 年,斯坦福 UMI 抓夹开源,行业一度沸腾。
一套 3D 打印的塑料架绑上一个 GoPro 相机,成本只需要 400 美元(约合 2800 元人民币),证明了“低成本采集”这条路走得通。
然而,UMI 有自己的天花板。
其精度只有厘米级,抓个积木、叠件衣服还行,但像拧螺丝、穿针引线、精密装配,但凡需要“手感”的任务,UMI 就训不出来了。
并且,它只能单臂操作,而人类 80%以上的日常操作场景需要双手协同。
现在,国内一支团队拿出了一套千元级的手持采集系统 UMI ver.2 并将其开源。
这套系统不仅是能实现毫米级精度、双臂协同的真正生产力工具,价格还只有传统方案的 1/100、甚至更低。
在成本已经被 UMI 打下来的基础上,UMIver.2 把精度和维度也提上去了。
项目地址: https://github.com/qiongming-intelligence/UMI
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜