具身智能突围:2026 WAIC七大巨头拆解从数据到落地的核心密码
在2026年世界人工智能大会(WAIC)的喧嚣展台背后,一场关于具身智能底层逻辑的深度对谈悄然拉开了行业进化的帷幕。由智元合伙人姚卯青发起,集结了Physical Intelligence研究科学家任至意、佐治亚理工学院徐丹飞、腾讯首席科学家张正友、Dyna Robotics联创马也骋、清华大学苏航教授以及Sunday创始人赵子豪等七位顶尖专家,这场圆桌对话直击当前物理AI领域最痛点的命题:在从数字世界向物理真实跃迁的关键期,究竟该如何跨越数据、表征与闭环的“三道物理墙”,让机器人的操作成功率达到商业级标准?
破除“物理三墙”:具身智能的底层困境与破局
智元的姚卯青率先指出,尽管过去一年行业在真机实勘中积累了大量经验,但具身智能的规模化应用仍面临三大结构性障碍。首先是“数据墙”,真实交互数据稀缺且采集成本极高,无法复制互联网数据的低成本规模化获取模式;其次是“表征墙”,不同机器人本体缺乏跨任务、跨模态的统一表征体系,导致模型泛化能力受限;最后是“闭环墙”,现实世界中的试错代价高昂,硬件损坏风险使得反馈迭代周期漫长。
为打破这三大壁垒,智元采取了模型与数据双轮驱动的策略,通过世界模型仿真与多机器人集群强化学习,构建“可泛化、可优化、可进化”的技术飞轮。这一思路强调了从知识规模化向真实世界经验规模化的范式跃迁,认为唯有让飞轮高速转动,才能触达物理AI的智能涌现点。
从“看懂”到“行动”:反馈学习与上下文理解的进阶
清华大学的苏航教授则将视角聚焦于“从观察到行动”的转化机制。他指出,具身智能不仅需要跨模态的基础认知能力,更亟需建立高效的“反馈学习”机制。通过主动观察环境并在交互中自主修正策略,机器人能显著提升任务成功率。这一理论为具身模型提供了扎实的底层框架,使得机器人不仅能“看懂”世界,更能“精准行动”。
然而,有了底层框架,如何高质量地处理海量异构数据成为下一道关卡。Physical Intelligence(PI)的任至意分享了他们在模型上下文(Context)理解上的突破。过去,模糊的指令和粗粒度的历史数据常将模型“带坏”,导致训练效果不佳。为此,PI团队引入高维多模态指导(Dance Multimodal Guidance),让模型具备预判任务完成画面能力,并首次在上下文中加入数据质量打分机制。这种“开天眼”式的训练策略,使得PI0.7模型实现了惊人的跨本体技能迁移——在低成本机械臂上学到的叠衣技能,可无缝迁移至工业级机械臂,且无需针对特定任务微调。
人类作为“教科书”:第一视角数据的革命性价值
当模型对数据的理解精度提升至新高度后,数据源头的拓展成为核心瓶颈。佐治亚理工学院的徐丹飞教授提出了一项颠覆性观点:人类本身就是机器人最好的“教科书”。
针对传统遥操作数据稀疏且难以捕捉精细物理智能(如揉面、拿捏薄卡片)的问题,徐丹飞团队坚定选择了“人类模仿”路线。通过采集2万小时的人类第一视角数据,团队观测到了具身智能领域清晰的线性Scaling规律:随着数据量的成倍增长,机器人的复杂操作成功率呈线性上升,甚至实现了零样本组装玩具小车的能力。这一路线不仅为行业突破数据荒提供了新范式,更暗示了只要机器人灵巧度达到一定阈值,直接从人类行为中学习策略是完全可行的。
“慢思考”与高可靠性:从实验室神童到产线工匠
Genesis AI的王尊玄进一步探讨了如何赋予机器人“慢思考”能力。他提出,除了依赖直觉系统的世界动作模型(World Action Model),机器人还需配备处理长程任务的推理模型(Reasoning Model)。这种双系统架构配合20万小时的混合预训练,大幅降低了新任务的上手门槛。实验数据显示,仅需少量数据即可实现切芹菜零失误、高精度堆叠等复杂操作,且普通采集员录制的数据即可用于模型微调,展现了极强的数据驱动泛化能力。
然而,从实验室的“神童”走向流水线的“熟练工”,可靠性是最终考验。Dyna Robotics的马也骋分享了其在真实产线部署的经验。他们构建了“数据金字塔”:底层为互联网与人类第一视角数据,中层为真机多任务数据,塔尖则是真实部署中犯错并成功恢复的高价值过程数据。这套混合数据炼成的基础模型,在江西南昌红旗3C产线中实现了24小时不间断作业,单次多日处理近6.5万件物品,成功率高达99.99%。马也骋强调,商业部署不追求“什么都会一点”的通用模型,而应死磕单项复杂任务的成功率,唯有跨过“可靠性”门槛,具身智能才算真正落地。
终局猜想:路线收敛与未来五年窗口期
在巅峰对话环节,专家们就算法路线、硬件本体与互联网数据价值展开了激烈碰撞。任至意与马也骋认为VLA与世界模型并非对立,未来趋势将逐渐收敛,且在特定场景下,世界模型在数据效率上更具优势。徐丹飞指出,评估模型的核心指标应聚焦于学习能力、泛化能力与实时性,而非单一架构之争。
关于硬件策略,智元姚卯青强调全栈研发能更好地理解端侧算力约束,推动端云结合架构;而腾讯张正友则认为,大厂的生态位可能更接近“大脑”提供商,创业公司应避免增量式改进,深入场景与数据挖掘独特价值。
对于“机器人的ChatGPT时刻”何时到来,与会专家给出了高度一致的乐观预判:姚卯青预计2年,任至意与马也骋认为是4-5年,徐丹飞与张正友认为3-5年,赵子豪甚至预测3年内实现。这一共识表明,行业正从技术探索期迈入产业化加速期,数据质量的优化、模型泛化能力的提升以及真实场景的闭环验证,将成为决定未来五年竞争格局的关键变量。具身智能不再是遥远的科幻概念,而是正在通过每一帧高质量数据、每一次精准反馈学习,一步步重塑物理世界的真实力量。