WAIC 2026深度解读:世界模型如何成为具身机器人的通用大脑?
2026年的上海,热浪与科技热潮交织。在世界人工智能大会(WAIC)的现场,具身智能已不再是一个边缘话题,而是占据了展馆核心的半壁江山。从宇树科技的机甲机器人到数以百计的初创企业展示,具身机器人正以惊人的速度从实验室走向商业应用的前台。企业数量从去年的80多家激增至200多家,这不仅是数字的增长,更是行业从技术探索转向实用主义的重要信号。然而,在喧嚣的展台背后,行业面临的核心挑战依然清晰:如何赋予机器人真正“理解”并“预测”物理世界的能力?世界模型,作为具身智能的“通用大脑”,其构建路径、技术瓶颈及应用前景成为了此次大会焦点中的焦点。

世界模型的核心定义:从视觉渲染到物理因果

世界模型究竟应该具备什么样的能力?是像视频生成模型那样预测下一帧画面,还是像传统控制算法那样输出动作指令?在WAIC的主论坛对话中,智元合伙人姚卯青、它石智航创始人陈亦伦以及亮源新创创始人姜旭三位行业头部人物,对世界模型的本质进行了深刻剖析。

姚卯青指出,世界模型的核心本质是理解物理世界运行规律的AI系统。与仅渲染画面的生成式模型不同,世界模型必须具备四项关键技能:多模态融合理解能力、物理规律掌握能力、因果推理能力以及长程推理稳定性。他强调,最重要的功能在于预测世界的下一个状态,而非仅仅模拟画面序列。这意味着模型需要理解“施加力导致物体移动”这样的因果逻辑,而非简单地学习像素变化。

陈亦伦则从强化学习的角度给出了更工程化的定义。他认为,具身智能领域的世界模型应能高频联合预测动作(Action)和状态(State)。相较于视觉-语言-动作模型(VLA)直接给出动作建议,世界模型不仅告诉机器人“做什么”,更预测“做了之后世界会变成什么样”,从而构成完整的强化学习三元组:状态、动作和奖励。这种框架的优势在于,它可以通过边缘化处理灵活地提取VLA模型,形成更完备的技术架构,确保在物理交互中的高成功率和任务质量。

姜旭的观点则更加犀利。他提出,预测下一个动作比预测下一个状态更为重要,因为世界模型的最终目的是控制机器人。人类在物理世界中更多是基于直觉和下意识做出动作,而非花费大量时间预测未来状态。因此,世界模型的突破路径应侧重于通过大规模模仿人类动作数据,训练出从感知到动作的高效映射。但他同时也警示,仅靠世界模型无法实现通用具身智能,必须经历可规模化的预训练、对齐以及商业化部署三次范式突破。

技术瓶颈:数据缺失与架构冲突

尽管前景广阔,但当前世界模型的发展仍面临严峻的技术瓶颈。其中最核心的问题在于真实物理交互数据的匮乏以及架构设计的内在冲突。

姜旭指出,主流的世界模型框架难以同时处理好感知(理解)和生成(重建)这两件本质相冲突的任务。感知需要理解语义和物理规律,而生成需要重建视觉细节,两者所需的表征方式截然不同。过去的尝试表明,试图用一套统一架构完美融合两者是极具挑战的,这也是为何当前架构往往偏向生成或理解某一端的原因。
陈亦伦进一步强调了数据维度的缺失。视频数据虽然丰富,但对于机器人操作而言,它缺乏关键的物理量信息,如力、触觉、柔性接触等。单纯通过视频无法推导出牛顿第二定律,因为视频只能提供几何信息和运动轨迹,无法体现质量和力的相互作用。要训练真正的物理世界模型,需要涵盖视觉、力觉、触觉等多模态数据,且数据量需达到千万小时级别。相比之下,自动驾驶领域仅需百万小时视频数据即可构建工业级系统,而具身智能因涉及更复杂的操作和接触,所需数据规模呈指数级增长。
姚卯青补充道,当前基于视频生成的预训练模型存在数据分布偏差。互联网上的视频内容往往包含娱乐性或创作性元素,甚至违背物理规律,这不适合用于严肃的具身智能训练。真实的具身数据需要包含丰富的接触场景、原子动作(推、拉、拧、拽)以及与不同材质物体的交互过程。这些高质量数据在互联网上稀缺,且难以通过物理引擎完全模拟,必须依赖真实世界的采集,数据规模需达到亿小时级别才能匹配语言模型在信息密度上的优势。
落地路径:工业刚需与家庭泛化的权衡
在明确了技术路径后,具身智能的落地场景选择成为资本和创业者关注的焦点。是优先攻克确定性强的工业场景,还是直接挑战开放复杂的家庭环境?
姚卯青倾向于“简单场景、简单任务”的突破策略。他认为,在环境可控、确定性强且具备一定容错空间的场景下,具身机器人更容易实现高成功率。智元近期在产线直播中展示的机器人编队,在连续6天的工作中完成了6万多件操作,成功率高达99.99%,节拍与人类近似,这证明了工业场景的可行性。相比之下,家庭环境因任务开放性和复杂性,需要更通用的泛化能力,短期内难以全面突破。

陈亦伦对制造业前景持乐观态度。他指出,制造业场景具有数据浓度高、任务界定明确、人类视角数据丰富等优势,与编码任务有相似性,非常适合构建具身智能框架。中国制造业在全球范围内的集中度和丰富性,为Physical AI提供了天然的试验场。它石智航通过“Foundation AI + APP”的路径,将汽车线束等真实场景1:1引入展台,并与龙头企业推动千台级工业机器人的集群部署,证明了技术路径的可控性与广阔前景。
姜旭则从大模型发展的历史规律出发,认为具身智能的落地应参考语言模型的演进路径。大模型突破依赖于大规模预训练,而互联网上积累的海量视频数据为预训练提供了基础。虽然视频数据存在噪音,但预训练模型具有强大的容错能力。然而,商业化落地的关键在于找到高容错率的场景。正如早期ChatGPT作为助手而非最终交付者,代码模型仅作为辅助,具身智能初期也应寻找容错率较高的场景进行爆发。他建议,具身智能公司应保持开放心态,进行广泛的场景探索,通过技术泛化能力在不同领域逐步渗透,而非局限于单一场景。
结语:迈向通用具身智能的必经之路
WAIC 2026不仅展示了具身智能的技术成果,更揭示了行业从技术崇拜转向务实落地的趋势。世界模型作为具身智能的通用大脑,其发展仍需跨越数据规模、多模态融合以及物理因果理解等多重障碍。工业制造场景因其高数据浓度和强反馈机制,有望成为首批规模化落地的突破口。然而,通用具身智能的最终实现,依赖于预训练、对齐与部署三大范式的持续突破。随着真实物理交互数据的积累和算法框架的创新,机器人终将真正“看懂”世界,并在更广泛的领域中发挥价值。这一过程并非一蹴而就,但每一步的技术精进都在推动着物理世界智能化的边界不断拓展。