WAIC具身智能圆桌:破解Scaling Law物理墙,机器人何时迎来ChatGPT时刻?

2 阅读

具身智能的“物理墙”与破局之道

在2026年世界人工智能大会(WAIC)上,具身智能板块无疑是关注度最高的焦点之一。与以往展示展台和Demo不同,本次大会中由智元合伙人姚卯青发起的圆桌论坛,被视为含金量极高的思想碰撞现场。与会者包括Physical Intelligence研究科学家任至意、佐治亚理工学院徐丹飞教授、腾讯首席科学家张正友等顶尖专家。他们共同探讨的核心议题直指行业痛点:在Scaling Law面临“物理墙”的背景下,物理AI如何迎来通用智能的涌现?

这场对谈不仅揭示了当前技术的瓶颈,更给出了从实验室走向商业落地的具体路径。核心矛盾在于,数字世界的智能可以通过海量数据快速迭代,但物理世界的智能却受制于数据采集成本、硬件反馈延迟以及试错的高昂代价。多位专家一致认为,打破这些壁垒的关键,在于数据范式的转变、模型架构的融合以及闭环系统的持续进化。

智元姚卯青:拆解数据、表征与闭环三堵墙

智元机器人合伙人姚卯青首先从一线实战角度,剖析了物理AI智能涌现的核心逻辑。他提出了“表征与闭环”的双螺旋驱动理论,即从单纯的知识规模化向真实世界经验规模化跃迁。然而,在实际落地过程中,行业面临着三道难以逾越的“物理墙”。

第一是数据墙。真实交互数据极其稀缺且获取成本高昂,无法像互联网文本数据那样轻易规模化。第二是表征墙。当前各类机器人本体各异,缺乏跨任务、跨本体的统一表示方法,导致模型泛化能力受限。第三是闭环墙。在现实物理世界中,试错代价极高,往往导致硬件损坏,且反馈循环极慢,难以支撑快速的模型迭代。

针对这三大挑战,智元采取了模型与数据双线并进的策略。通过构建高精度世界模型进行仿真训练,结合多机器人集群强化学习,旨在打造一个可泛化、可优化、可进化的技术飞轮。姚卯青强调,只有让飞轮高速转动,才能突破智能涌现的临界点,这不仅是技术路径的选择,更是物理AI走向通用的必由之路。

PI任至意与清华苏航:从“看懂”到“精准行动”

清华大学苏航教授随后分享了在具身基础模型与反馈学习方面的最新进展。他指出,具身智能不仅需要强大的跨模态认知能力,更需要建立高效的“反馈学习”机制。通过让机器人主动观察环境并在交互中自主修正动作策略,可以显著提升任务成功率。这一工作为机器人从“被动执行”转向“主动适应”提供了理论支撑。

在这一基础上,Physical Intelligence(PI)团队的研究科学家任至意进一步探讨了模型如何处理复杂的上下文(Context)信息。任至意直言,以往将历史信息和粗粒度语言指令直接输入模型的做法,往往会导致模型被“带坏”,因为模型难以区分高质量的标准动作与无效的干扰数据。

为解决这一痛点,PI团队在PI0.7模型中引入了上下文的大规模升级。他们借鉴大语言模型和视频生成模型的技术,开发了“Dance Multimodal Guidance”高维引导机制,使模型能够预判任务完成后的画面。更关键的是,他们在Context中加入了数据质量打分机制,如同给模型开了“天眼”,使其能识别数据的优劣。这一创新使得PI0.7实现了跨本体技能迁移,例如在低成本机械臂上训练的叠衣服技能,可无缝迁移至工业级机械臂,且无需特定任务微调,只需自然语言指令即可实现零样本操作。

徐丹飞:人类是机器人最好的“教科书”

当模型对数据的理解达到新高度后,数据源的瓶颈便凸显出来。佐治亚理工学院徐丹飞教授提出颠覆性观点:人类本身就是最好的老师。他批评了传统遥操作数据采集的低效性,认为其难以捕捉精细的物理智能,如揉面或拿取薄卡片等动作。

徐丹飞团队自2023年起深耕人类第一视角数据采集,目前已积累高达2万小时的高质量数据。通过这种“把人当机器人训”的方式,团队观测到了具身智能领域的线性Scaling规律:随着数据量的倍增,机器人复杂操作成功率显著提升,甚至能实现玩具小车的零样本组装。这一路径为行业突破数据荒提供了全新思路,证明了人类经验在物理世界中的巨大价值。

Genesis AI与Dyna Robotics:慢思考与高可靠性

Genesis AI的联合创始人王尊玄则聚焦于提升机器人在真实世界中的“思考”能力。他提出,除了基于世界模型的直觉系统,机器人还需配备处理长程任务的“慢思考大脑”(Reasoning Model)。结合20万小时混合预训练数据,这种双系统架构大幅降低了新任务的上手门槛。演示案例显示,仅需极少量数据,机器人即可实现切芹菜零失误、高精度堆叠等高难度操作。更令人惊讶的是,普通采集员通过简单录制视频,即可教会模型新动作,展现出极强的Data-Driven泛化能力。

Dyna Robotics首席科学家马也骋则从商业部署角度强调了“可靠性”的重要性。他提出了“数据金字塔”概念:底层利用互联网和人类数据铺底,中间层使用真机多任务数据过渡,塔尖则聚焦于机器人真实部署中犯错并恢复的高价值数据。将20万小时混合数据炼成的基础模型投入江西南昌红旗3C产线实战后,机器人实现了24小时连续作业,成功率高达99.99%。马也骋指出,通用模型若无极高的单项任务成功率,在商业场景中毫无价值。创业公司的使命是在保证通用的前提下,死磕复杂任务的极致可靠性。

圆桌高峰对话:路线之争与终局猜想

在圆桌对话环节,与会专家就算法路线、硬件策略及大厂格局进行了深入交锋。

关于主流算法路线,任至意认为VLA与世界模型并不冲突,原生理解Context对未来建模有益,技术趋势将逐渐收敛。马也骋补充道,在特定场景下,世界动作模型(WEM)比VLA更高效,但仍需Reasoning Model支撑长程任务。徐丹飞指出,无论何种架构,核心指标在于学习能力、泛化能力和实时性。张正友则强调,具身智能Agent应包含认知、感知行动和肢体反应三层闭环,单一小模型无法解决所有问题。

在硬件与大脑的关系上,Tony认为当前瓶颈在于“大脑”不够聪明,而非灵巧手;任至意主张先用低成本本体搭建基础设施以加速模型研发;姚卯青则坚持全栈研发,通过端云结合架构优化算力约束。

针对互联网数据价值,张正友指出人类熟练操作时手部往往不可见,需结合异构操作数据与仿真数据提升精度。对于大厂入场的威胁,马也骋认为机器人对延迟敏感,必须本地运行,创业公司应坚持自研或基于开源的本地模型路线。张正友则以PC时代Mac与Windows共存为例,建议创业公司避开大厂的增量式改动,深入场景与数据思考,寻找差异化生存空间。

最后,关于“机器人的ChatGPT时刻”何时到来,专家们给出了3至5年的预期:姚卯青认为是2年,任至意和徐丹飞认为是4至5年,张正友预测3至5年,而Tony则乐观估计在3年以内。尽管时间预估略有差异,但行业对于技术突破的信心日益增强,具身智能正从实验室加速迈向产业深水区。