具身智能为何卡在“前GPT时代”?2026 WAIC揭示三大落地鸿沟
2026年世界人工智能大会(WAIC)的展台上,聚光灯下机器人正在熟练地叠衣服、冲泡咖啡、精准切菜以及高效分拣货物。从繁忙的工业产线到充满生活气息的厨房灶台,具身智能(Embodied AI)似乎已经触手可及,仿佛即将全面重塑我们的物理世界。然而,若将视角从展台移至幕后,与那些真正深耕一线的从业者深入交谈,听到的判断却更为保守且务实。这个行业的实际演进速度,远没有展台画面所呈现的那么接近终点。
物理世界的Scaling Law:三道难以逾越的墙
大模型在数字世界中依靠海量数据的堆叠实现了能力的涌现,但这一规律在物理世界中遭遇了严重的水土不服。智元机器人联合创始人姚卯青将具身智能面临的挑战归纳为“三道墙”:数据墙、表征墙与闭环墙。这三者相互锁死,构成了当前技术突破的核心瓶颈。
首先是数据墙。在互联网时代,文本数据可以持续累积且获取成本极低,但机器人面对的物理交互数据不仅稀缺,而且极其昂贵。真实的物理世界交互无法像复制文件那样低成本复制。
其次是表征墙。跨任务、跨场景、跨本体的统一表征尚未形成。与文本Tokenization的相对成熟相比,物理世界的感知与表征要复杂得多,目前缺乏一个能够无缝衔接不同形态和场景的统一描述语言。
最后是闭环墙。在真实世界中试错的代价高昂,反馈周期慢,且操作不可回滚。这种高成本、慢反馈的特性,使得具身智能难以像数字世界中的算法那样通过快速迭代实现指数级进步。
面壁智能姚远则从模块成熟度的角度提供了另一种视角。目前,语言模型最为成熟,多模态感知能力达到了70%至80%,但行动控制(Action)模块的成熟度可能仅有40%。这种模块间的不平衡,导致Scaling Law在具身智能领域无法简单复制。更关键的是,当前主流的视觉-语言-动作(VLA)端到端范式,往往缺乏真正的“语言”推理能力,导致其在处理需要长程规划、步骤拆解和中间判断的复杂任务时显得力不从心。没有语言思维的介入,机器人在面对非结构化环境时,往往陷入“有感知无智慧”的困境。
路线未定:BERT/GPT/T5式的混沌期
如果说问题已经明确,那么解决方案的探索则充满了不确定性。当前的具身智能技术路线,正如2018年大模型爆发前的BERT、GPT、T5三足鼎立阶段,尚无明确的收敛方向。
目前至少存在三条并行路线:一是VLA端到端路线,直接建立感知到动作的映射;二是世界模型路线,通过预测物理状态的变化来指导决策;三是智元提出的WRAM(世界推理动作模型),试图将世界模型与语言推理能力整合。智元姚卯青认为VLA因缺失语言模块而无法胜任长程规划,而面壁智能和Physical Intelligence则倾向于将VLA与世界模型融合,以弥补这一短板。
腾讯张正友提出了不同的分层协同观点。他认为认知系统、感知行动系统和底层反应系统应在不同频率上运行。底层反应需要100赫兹甚至更高的频率,而大模型推理的速度仅为10赫兹左右,无法满足即时避障等物理交互需求。单一模型试图包打天下,在物理实时性上存在天然缺陷。
此外,姚卯青指出了一个更底层的“原生架构”问题。当前使用的Tokenizer、Encoder等组件,大多是从视觉问答(VQA)和对话模型中借用而来,并非为具身任务原生设计。这种“改装发动机”的模式,只有当数据规模达到百万小时级别时,才可能催生出真正的“原生引擎”。在此之前,行业的路线之争可能仍停留在浅层架构的调整,真正的技术分歧需等待数据规模和基础设施的成熟。
演示与量产:隔着“工程量”的巨大鸿沟
展台上的3分钟叠衣表演,赢得满堂喝彩;但工厂产线要求的却是6秒节拍和99.8%的准确率。从“能演示”到“能干活”,中间隔着巨大的工程量与可靠性鸿沟。
博世智能科技刘敏给出了制造业的严苛标准:99.8%的准确率和6秒的节拍是门槛。智元在南昌3C工厂的实践中,虽然达到了99.99%的成功率,但这背后是数月甚至半年的硬件软件集成、MES系统对接以及通宵达旦的压测。从零到一的周期长达三四个月,即便产品化后,复制速度也仅为一两周一个点。
硬件可靠性更是行业痛点。越疆科技刘培超指出,机器人至少需要20个关节起步,复杂度超越汽车,行业标准要求5万小时的平均无故障时间(MTBF)。然而,目前大部分机器人可能连10小时的MTBF都难以保证。灵巧手的状况更为严峻,数据采集困难,且存在严重的散热问题,核心零部件远未达到汽车行业的16949质量标准。
艾欧智能丁哲章揭示了行业预期的断层:场景方对具身智能的期望,与本体现实能力之间存在巨大落差。他提出“渐进式落地”的思路,即机器人做一部分,人监管一部分,接受这种“中间状态”。回顾发展历程,2022年是“PPT阶段”,2023年是本体能动但受限,2024年是具备部分自主能力,而2026年,行业正处在从“部分可用”向“广泛可用”过渡的艰难爬坡期。
时间线重构:2027-2028或迎真正涌现
综合多位核心从业者的判断,具身智能的发展时间表正在被重新校准。
姚卯青预测,2027年底至2028年初可能会看到较强的能力涌现时刻。面壁智能刘知远认为端侧模型还需要1到3年的迭代。丁哲章则以自动驾驶为鉴,指出自动驾驶十年才实现“差不多可用”,具身智能同样需要经历从高预期到预期修正,最终贴近现实的漫长过程。张正友则以ChatGPT为参照,强调只有当失败概率极低、用户能够真正依赖时,技术才算真正成熟。
光轮智能杨海波给出了更具体的预测:2026年是“跑通”年,重点在于验证技术可行性;2027年则是“算账”年,本体价格有望降至今年的十分之一,稳定性提升百倍。如果硬件可靠性在明年取得突破,将为规模化应用奠定基础。然而,软件、数据、评测等基础设施的缺口,不会随硬件改善自动消失。
总体来看,短期内(今明两年),具身智能将在特定工业场景实现工程化跑通;中期(2027-2028),随着数据积累与架构优化,可能出现能力涌现的关键节点;而从工厂走向家庭,从结构化走向非结构化,通用具身智能的普及之路,远比外界预期的要漫长且曲折。
展台上的高光时刻固然令人振奋,但真正决定行业高度的,是那些未建成的数据标准、缺失的评测体系以及尚未解决的零部件可靠性问题。正如姚远所言:“当前最火的不一定能笑到最后。”在2026年的WAIC,这句话不仅是对技术路线的提醒,更是对整个行业回归理性、深耕底层基础设施的呼唤。具身智能的终局,或许不在聚光灯下,而在无数个日夜的迭代与打磨之中。