WAIC 2026 观察:七位顶流拆解具身智能“物理墙”,通用机器人何时落地?
物理智能的“破壁”时刻:从理论共识到产线实战
在人工智能的演进版图中,大语言模型(LLM)已经证明了数据规模与智能涌现之间的强相关性,但这一规律在物理世界的应用中却遭遇了显著的阻力。世界人工智能大会(WAIC)期间,一场由智元合伙人姚卯青发起,汇聚了腾讯首席科学家张正友、佐治亚理工学院徐丹飞教授、PI研究科学家任至意、Genesis AI王尊玄、Dyna Robotics马也骋首席科学家以及Sunday团队赵子豪等七位行业顶尖专家的圆桌对话,不仅揭开了具身智能领域技术路线的迷雾,更直面了从实验室模型到商业部署之间那道难以跨越的鸿沟。
这场对话的核心议题并非虚泛的技术愿景,而是极其务实的工程难题:在数据墙、表征墙和闭环墙三重阻碍下,物理AI如何突破Scaling Law的物理极限?答案不再局限于单一的算法优化,而是指向了数据获取范式的根本性转变、模型架构的融合创新,以及软硬件协同的深度迭代。
智元姚卯青:拆解阻碍具身智能的三堵“物理墙”
智元机器人作为具身智能领域的先锋企业,其联合创始人姚卯青首先从一线实战角度剖析了行业面临的结构性障碍。在过去一年的真机迭代中,智元团队深刻体会到,具身智能的核心在于“表征与闭环”的双螺旋驱动,即从知识规模化的训练向真实世界经验规模化的跃迁。
然而,这一过程并非坦途。姚卯青指出,行业目前被困在“数据墙”、“表征墙”与“闭环墙”之中。首先是数据墙,高质量的人机交互数据极度稀缺且获取成本高昂,无法像互联网文本数据那样通过爬虫轻松规模化;其次是表征墙,不同形态、不同构型的机器人缺乏统一的跨任务、跨本体表征方式,导致模型泛化能力受限;最后是闭环墙,物理世界中的试错代价极高,一次失败可能导致硬件损坏,且反馈周期远长于数字世界。
面对这三大瓶颈,智元选择了模型与数据双轮驱动的破局策略。通过构建高保真的世界模型进行仿真训练,结合多机器人集群强化学习,试图打造一个可泛化、可优化、可进化的技术飞轮。这种策略的本质,是通过数字世界的低成本试错来弥补物理世界数据获取的不足,从而加速智能涌现的过程。
清华苏航与PI任至意:让机器人具备“细粒度”认知能力
如果说硬件与数据是基石,那么模型的认知能力则是具身智能的灵魂。清华大学苏航教授聚焦于“从观察到行动”的反馈学习机制,指出具身基础模型不仅要具备跨模态的强认知能力,更需建立高效的反馈修正机制。通过让机器人在交互中主动观察环境并自主修正策略,可以显著提升复杂任务的成功率。
在此基础上,Physical Intelligence (PI) 的任至意带来了关于上下文(Context)处理的深度思考。PI团队近期发布的PI0.7模型在业界引起了广泛关注,其突破在于解决了“模型被坏数据带偏”的痛点。任至意坦言,过去的模型往往因为指令模糊、缺乏重点,难以区分高质量的标准动作与无效的干扰数据。
为了解决这一问题,PI团队引入了视频编码器与高维的Dance Multimodal Guidance技术,使模型能够预判任务完成后的画面状态,并创新性地引入了数据质量打分机制。这种“开天眼”式的训练策略,使得PI0.7无需针对特定任务进行微调,即可在多个复杂场景中通用,甚至实现了跨本体技能迁移——例如将廉价机械臂上习得的叠衣技能,无缝迁移至工业级UF5机械臂上。这一突破标志着具身智能从“专用模型”向“通用基础模型”迈出了关键一步。
徐丹飞教授:人类第一视角数据,破解数据荒的终极钥匙
当模型架构逐渐成熟,数据的来源与质量成为了新的焦点。佐治亚理工学院徐丹飞教授抛出了一个颠覆性的观点:人类本身就是最好的教科书。
徐丹飞团队长期致力于人类第一视角(First-Person View)数据的采集与研究。他指出,传统的遥操作数据采集不仅效率低下,而且容易掩盖人类在精细操作中的隐性物理智能,如揉面、拿捏薄卡片等细微动作。相比之下,人类在日常生活中的第一视角视频记录了海量的物理交互经验。
通过大规模采集人类佩戴头戴设备的第一视角数据,徐丹飞团队在2万小时的数据规模上观测到了具身智能领域的线性Scaling规律。数据量的成倍增加直接带动了机器人复杂操作成功率的大幅提升,甚至实现了零样本组装玩具小车的能力。这一发现为行业指明了一条通过模仿人类自然行为来突破数据瓶颈的新路径,即“把人当机器人训”,利用人类海量的生活经验数据来预训练通用具身模型。
Genesis AI王尊玄与Dyna马也骋:从“直觉”到“推理”的双系统架构
在模型泛化能力提升的同时,如何处理长程复杂任务并保证高可靠性,是走向商业化的最后一道关卡。Genesis AI的王尊玄提出了“直觉-推理”双系统架构。他建议,除了依赖世界动作模型(World Action Model)提供的快速直觉反应外,必须引入慢思考的推理模型(Reasoning Model)来处理长程逻辑与规划。这种双系统架构在Dyna Robotics的实践中取得了显著成效,仅通过数小时的少量数据后训练,机器人便能实现无限循环切芹菜零失误,或在高精度堆叠任务中一把过。
Dyna Robotics的首席科学家马也骋则将视角转向了更残酷的商业现实。他强调,实验室里的“神童”必须在流水线上成为“熟练工”。Dyna团队构建了独特的“数据金字塔”,底层利用互联网数据,中间层使用真机多任务数据,而塔尖则是机器人在真实部署中犯错并完成恢复(Recovery)的高价值数据。将20万小时混合数据炼成的模型直接部署于南昌红旗3C产线,机器人实现了24小时连轴转、成功率高达99.99%的硬核表现。马也骋指出,通用模型的泛化能力固然重要,但在商业场景中,单一任务的成功率与可靠性才是决定价值的核心指标。
巅峰对谈:路线分歧与终局猜想
在圆桌对话的高潮部分,七位专家就行业共识与未来趋势展开了激烈碰撞,主要聚焦于以下三个核心维度:
第一,算法路线的收敛与分歧。 任至意认为VLA与世界模型并不冲突,未来技术趋势将逐渐收敛,原生理解上下文并建模未来的模型将具备更强的表征能力。马也骋则指出,在某些特定场景下,世界动作模型比VLA更高效,但需结合推理模型。徐丹飞强调,最终赢者并非特定架构,而是具备长程索引或Context学习能力的模型。张正友博士则从人类认知系统角度提出,具身智能Agent应包含认知、感知行动和肢体反应三层闭环,单一小模型难以解决所有问题。
第二,全栈自研与云端大脑的博弈。 在硬件策略上,Sunday团队主张以低成本获取80%能力的权衡策略,认为瓶颈在于“大脑”而非“手脚”。任至意倾向于先搭建低成本本体以加速模型研发,长期再考虑可靠硬件。姚卯青则坚持全栈自研,认为只有在端侧算力受限等约束条件下,才能优化出最高效的端云协同架构。徐丹飞则从科研角度假设,只要灵巧度达到一定水平,人类数据即可直接驱动策略学习。
第三,大厂的威胁与创业公司的机遇。 马也骋指出,机器人策略对延迟极度敏感,必须本地运行,这为坚持本地模型自研的创业公司提供了生存空间。张正友则比喻,PC时代的Mac与Windows共存证明了全栈与纯软件模式皆可成功,创业公司应避开增量式改动,在场景与数据深度上寻找突破。
关于“机器人的ChatGPT时刻”,各位专家给出了谨慎乐观的预判: 姚卯青预测2年,主要取决于数据进展;任至意认为4-5年;徐丹飞与马也骋均认为是4-5年;张正友给出3-5年的区间;Sunday团队则更为激进,认为3年以内。尽管时间预判存在差异,但共识在于:这一时刻的到来,不再依赖单一技术的突破,而是数据、模型、算力与场景协同进化的结果。
结语:从技术验证到产业深耕的必然转折
这场WAIC上的顶级对话,清晰地勾勒出具身智能行业的进化轨迹:从早期对算法架构的探索,转向对数据质量、物理仿真与商业可靠性的深度深耕。随着人类第一视角数据规模的扩大、世界模型精度的提升以及端云协同架构的成熟,具身智能正逐步跨越从实验室演示到规模化部署的“死亡之谷”。
未来的具身智能竞争,不再是单纯的技术秀场,而是对数据效率、场景理解与系统可靠性综合能力的考验。对于行业参与者而言,唯有扎根真实场景,构建高质量的数据飞轮,并在软硬件协同中寻找最优解,才能在即将到来的商业化浪潮中占据一席之地。具身智能的“iPhone时刻”或许尚未到来,但其前奏已然清晰可闻。