具身智能破局:WAIC七巨头解码物理AI数据飞轮与通用性拐点

2 阅读

物理AI的“三重困境”与破局思路

在2026年世界人工智能大会(WAIC)期间,一场围绕具身智能(Embodied AI)核心命题的圆桌对话,成为了整个会议最具含金量的技术观察窗口。由智元机器人合伙人姚卯青发起,汇聚了Physical Intelligence研究科学家任至意、佐治亚理工学院徐丹飞教授、腾讯首席科学家张正友、Dyna Robotics联创马也骋、Sunday创始人赵子豪以及清华大学苏航教授等七位顶尖学者与行业领袖。他们共同聚焦于“Scaling Law的物理墙”这一关键议题,探讨了物理AI如何跨越从数字模拟到真实世界落地的鸿沟。

姚卯青在开场中敏锐地指出,尽管数字世界的智能涌现已蔚为大观,但物理世界仍存在三堵难以逾越的“墙”。首先是“数据墙”,真实交互数据稀缺且昂贵,无法像互联网文本那样低成本规模化获取;其次是“表征墙”,不同机器人本体和任务缺乏统一的跨任务表征标准;最后是“闭环墙”,物理世界的试错成本极高,硬件损坏风险大,导致反馈延迟严重。打破这三堵墙,需要依靠世界模型仿真与多机器人集群强化学习的“双螺旋驱动”,实现从知识规模化向真实经验规模化的范式跃迁。

数据获取的革命:人类作为最佳教科书

在解决数据稀缺问题上,徐丹飞教授提出了一种颠覆性的视角:人类本身就是机器人最好的“教科书”。传统的遥操作数据采集方式不仅效率低下,更难以捕捉诸如揉面、抓取薄片等高精度的物理智能细节。徐丹飞团队自2023年起便致力于收集人类第一视角(First-Person View, FPV)数据,目前已在英伟达平台上验证了2万小时的高质量人类操作数据。

这一策略带来了显著的线性Scaling规律:随着数据量的成倍增加,机器人处理复杂任务的成功率呈现指数级上升。实验数据显示,经过海量数据训练的模型甚至实现了零样本组装玩具小车的壮举。这种“以人训机”的路径,不仅规避了遥操作的局限性,更为解决具身智能的数据荒提供了一条经过验证的高效通道。它揭示了在具身智能领域,数据的质与量同样关键,而人类自然行为中蕴含的隐性物理知识,是纯仿真数据无法替代的宝贵资产。

模型架构演进:上下文扩展与多模态引导

如果说数据是燃料,那么模型架构就是引擎。Physical Intelligence(PI)团队的任至意分享了其在提升模型上下文理解能力方面的最新突破。他指出,以往模型在处理历史信息时容易受到噪声干扰,导致策略偏差。为此,PI团队在PI0.7模型中引入了“Dance Multimodal Guidance”高维多模态引导机制,并结合视频编码器,使模型能够预判任务完成后的视觉状态。

更具创新性的是,PI团队首次在上下文训练中加入数据质量打分机制,相当于赋予模型识别数据“好坏”的能力。这一改进带来了显著的效果:PI0.7不再依赖特定任务的微调,仅凭单一Checkpoint即可应对多种复杂场景,并实现了跨本体的技能迁移——在低成本机械臂上习得的叠衣技能,可直接应用于工业级机械臂。这种具备长程上下文理解能力的模型,标志着具身智能从“指令跟随”向“意图理解”的关键转变。

推理机制升级:慢思考与快反应的协同

随着模型感知能力的提升,如何处理长程复杂任务成为新的瓶颈。Genesis AI的王尊玄提出了“双系统”架构理念,即“快思考”与“慢思考”的结合。所谓的“快思考”是指基于直觉的世界动作模型(World Action Model),它数据效率高且反应迅速;而“慢思考”则是指推理模型(Reasoning Model),负责处理需要逻辑规划的高层任务。

通过这种混合预训练架构,Dyna Robotics成功降低了新任务的上手门槛。案例显示,仅需少量数据演示,机器人即可实现高精度、零失误的连续操作,如切芹菜或堆叠易碎品。更令人瞩目的是,这种高效的后续训练(Post-Training)过程已实现自动化,普通采集员录制的数据即可触发模型对新动作的学习,并具备零样本抓取未知物体的能力。这种Data-Driven的泛化能力,极大缩短了从研发到部署的周期。

商业落地的终极考验:可靠性与数据金字塔

尽管实验室中的模型表现惊艳,但商业化落地仍需面对严苛的可靠性要求。Dyna Robotics的马也骋分享了其在真实工业场景中的部署经验。他强调,真正的具身智能必须具备在真实世界中犯错并恢复的能力。为此,团队构建了“数据金字塔”:底层基于互联网和人类第一视角数据,中层使用真机多任务数据,塔尖则是机器人在真实部署中犯错及恢复的高价值过程数据。

这套模型在江西南昌红旗3C产线经过了严苛测试。在24小时连续运行的测试中,机器人完成了近6.5万件任务,成功率高达99.99%。马也骋指出,行业目前缺乏的不是“通用”能力,而是“高可靠”的单项任务执行能力。只有将特定场景下的成功率死磕到极致,具身智能才能真正跨越从实验室到工厂的“死亡之谷”。

路线之争与终局展望

在圆桌对话的最后环节,与会嘉宾就主流算法路线、软硬件一体化及大厂角色等话题展开了深入交流。

关于VLA(视觉-语言-动作模型)与世界模型(World Model)的关系,任至意认为两者并不冲突,未来的趋势是两者的收敛。马也骋则从效率角度出发,认为在特定场景下世界动作模型比VLA更高效,但需要推理模型支撑长程任务。徐丹飞强调,无论架构如何,核心指标始终是学习能力、泛化能力和实时性。张正友教授则提醒行业,具身智能应包含认知、感知和行动三层闭环,单一小模型难以解决所有问题。

在硬件本体方面,Sunday的赵子豪认为当前瓶颈在于“大脑”而非“灵巧手”,应追求成本与能力的平衡;姚卯青则坚持全栈研发的重要性,通过端云协同架构优化系统效率。徐丹飞推测,随着灵巧度提升,机器人将能直接从人类数据中学习策略。张正友指出,互联网数据虽有用,但精密操作仍需异构数据与仿真补充。

面对大厂入局,马也骋认为机器人对低延迟的高要求使其难以完全依赖云端API,创业公司应坚持本地模型自研。张正友则以PC时代Mac与Windows共存为例,预言“全栈”与“只做大脑”模式将并存,创业公司应在场景和数据挖掘上寻求差异化突破。

对于具身智能“ChatGPT时刻”的到来,共识逐渐形成:姚卯青预计2年,任至意和马也骋预计4-5年,徐丹飞和张正友预计3-5年,赵子豪甚至预测3年内即可实现。这一时间表的收敛,表明行业对数据积累、模型突破及工程部署的信心正在快速增强。具身智能正从技术探索期迈向规模化落地的关键转折期,物理世界的智能涌现已成为不可逆转的趋势。