← 返回新闻列表
InfoQ AI 🗓️ 2026-07-29

清华教授李升波提出具身智能破局新路线:物理原生智能是实用化答案,世界模型成核心,这一消息引发行业关注

⚡ 一句话看懂:清华教授李升波提出具身智能破局新路线:物理原生智能是实用化答案,世界模型成核心,这一消息引发行业关注。来源:InfoQ AI。

近日,在 WAIC 现场,清华大学车辆与运载学院、人工智能学院教授李升波发表了题为《迈向泛在具身智能之路:物理原生的世界模型、数据结构与训练算法》的主题演讲,提出了“物理原生智能”(Physics-native Intelligence, Phi)的概念,并系统阐述其核心特征与技术体系,为破解具身智能的根本性难题提供了全新范式。

李升波指出,物理原生智能具备三项核心特征。

第一,利用状态而不是观测表征世界且状态需要解耦:系统的状态由物理模型的“显状态”和神经网络的“隐状态”两部分构成,兼顾准确性与泛化性。

第二,模型结构满足时序性和因果性:遵循时序优先的原则,原因先于结果,动作规划尽量减少对未来信息“预测”的依赖。

第三,训练过程须嵌入底层物理规律的约束,例如对称性和守恒性,以及动力学系统的辛几何结构等。

以下内容根据李升波教授现场演讲整理,略有删节: 人工智能是这个时代最热门的主题,也是最重要的技术方向。

过去十年,人工智能领域出现了一系列里程碑事件,从 ResNet,到 AlphaGo,再到 ChatGPT,DeepSeek,每一次都引起全世界的广泛关注与热议。

我们探讨 AI,研究 AI,开发 AI,到底追求什么?

我想大家的目的是一致的,是让智能更加“通用化”。

唯有具备通用的能力,才能叫做智能。

若想称一个系统具有智能,也只能靠它的“通用化”能力才能证明。

到今天为止,无论是视觉智能、语言智能,还是融合视频、图像、文本的多模态智能,实际上都在追求“通用化”这一目标的。

作为人工智能的当前热点,具身智能也是以通用化为目标的。

什么是具身智能呢?

人类就是具身智能的典型代表。

类似人类与周围环境的交互,具身智能体要与物理世界进行交互,通过感知这个世界,做出合乎逻辑的决策,然后执行一定的动作,进而影响这个世界的某一实物对象。

具身智能体影响的物理实体越多,它的通用化能力就越强,智能性也就越好。

具身智能并非一个全新的概念,汽车领域的工程师是最早的开拓者与实践者。

自动驾驶是首个量产化的具身智能系统,机器人是当前大家关注的重点,未来世界或许将与一切可交互的物理实体进行接触,这将是泛在的具身智能世界。

然而,通用化的具身智能容易开发吗?

我的感受是挑战是巨大的,比视觉、语言领域更加困难。

大家都知道,自动驾驶汽车即使到今天,其智能性远未达到人类驾驶员的水平,功能限于 L2 级驾驶辅助,尚未达到 L4 级的能力。

与汽车相比,机器人的自由度更高,场景结构更复杂、交互对象更多样,如何开发它的通用具身智能体,是摆在学术界、工业界全体同仁面前的重大难题。

具体而言,这两类对象仍然以端到端模型训练为主要技术路线。

从目前的实践看,汽车大概需要百亿级别的网络参数、亿级的驾驶片段,而机器人考虑到它的本体、场景更加复杂,大概需要万亿级别的网络参数,千亿级别的交互片段,训练难度至少是汽车的十倍以上。

若仍然沿用现有的视觉、语言、多模态大模型训练思路,我们能否达到通用化的目标呢?

答案是显而易见的,不具有可行性。

十分幸运的是,过去六十年,人工智能领域的先贤圣哲们给了我们很多启发,让我们从另外一个角度思考智能的开发范式。

比如说:McCarthy 建议重视世界的一般性表征,Pearl 告知我们要考虑人类认知的因果关系,Hopfield 曾说嵌入物理系统的集体属性。

以这些大师们的思想为基础,结合近十年人工智能的技术进展以及具身智能的应用需求,我们逐步形成了“物理原生智能”的概念、特征与技术体系,今天向大家进行系统性的介绍。

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接