腾讯具身智能困局:全栈平台策略在物理AI时代的边界重塑
2026年的世界人工智能大会(WAIC)现场,腾讯带来的“具身智能全栈方案”格外引人注目。从底层的Hy-Embodied系列模型,到中间的TairosAgent等平台层,再到应用层的EaaS服务,这套四层架构旨在构建一个完整的闭环。腾讯首席科学家张正友将其概括为“打破缸中大脑”,意在强调AI需要在真实的感知、身体和行动反馈中接受物理世界的验证。这标志着腾讯在具身智能领域的布局,从一年前RoboticsX实验室提出的“三不原则”——不做硬件、不做量产、不搞商业化,升级为全面介入的技术赋能者。然而,这种从“模块化外接大脑”到“全栈闭环”的转变,能否在物理AI时代复刻移动互联网时期的平台成功?答案或许并未想象中乐观。
互联网时代的核心逻辑在于降低交易成本,通过连接供需双方实现网络效应。腾讯云算盘打得极清:硬件是重资产、低毛利且供应链复杂的苦活,而大脑和平台层一旦形成生态,边际成本递减,可以通过云服务持续变现。这一逻辑在软件和服务领域无往不利,但在具身智能赛道,行业现实却给出了完全不同的反馈。2025年被业界称为头部人形机器人创企进入“自研大脑时代”的转折点,到了2026年,这一趋势已不可逆转。几乎所有头部玩家都选择了自研核心算法,拒绝将“大脑”外包。
以智元机器人为例,这家由腾讯领投B轮的企业,在2026年3月累计下线量突破10000台的同时,坚持自研启元大模型GO-1和交互大模型WITA Omni。其合伙人姚卯青直言:“机器人公司如果不做大模型,是没有未来的。”同样,智平方在2026年6月完成近50亿元融资后,推出了具备主动感知、故障自恢复与时序记忆能力的NeuroVLA类脑系统;银河通用则搭建了百亿级合成数据基建“银河星坊”,支撑其自研的AstraBrain模型。甚至包括宇树科技在内的硬件厂商,也在2026年初宣布开源其基座模型UnifoLM-VLA-0。这些案例共同指向一个事实:在具身智能领域,具备强大AI能力且同时涉及本体的公司,已成为资本市场的香饽饽。缺乏自研大脑的玩家,正在加速掉队。
这种自研热潮的背后,是具身智能与互联网在数据属性上的本质差异。在大语言模型时代,数据更多是文本的堆砌,公开互联网上的文本足以训练出强大模型。但在具身智能中,数据是核心生产资料,且具有极高的获取成本。机器人的每一次抓取、搬运、行走,都依赖于昂贵的真机操作或高成本的仿真合成。美国Physical Intelligence公司的π0模型一年仅收集1万小时数据,而Qwen-2.5的训练数据量相当于真人12亿小时。研究者估算,按当前速度,具身智能要达到大语言模型的智能水平,需要12万年。这意味着数据不仅是稀缺资源,更是核心壁垒。

数据的稀缺性导致了“数据不可能三角”的形成:质量、规模、成本难以兼得。智元自建AGIBOT WORLD数据集,智平方积累20毫秒级碰撞反射响应数据,银河通用投入百亿级合成数据,这些都不是共享资源,而是各自的核心竞争力。将物理世界的交互数据交给第三方平台训练,等同于泄露商业机密。因此,腾讯Tairos平台所依赖的“标准化方案”前提,在数据高度封闭的产业现实面前显得颇为脆弱。机器人厂商没有动力配合一个无法垄断其核心数据资产的通用平台。
除了数据壁垒,技术架构的深层挑战在于“大脑”与“本体”的不可割裂性。腾讯首席科学家张正友提出的SLAP范式(感知-行动紧耦合),实际上已经揭示了这一本质。人类的认知系统之所以高效,是因为大脑在进化过程中始终与身体共同优化。同理,机器人的模型架构必须与特定本体的运动学和动力学深度适配。智元的ViLLA架构、智平方的“皮层-小脑-脊髓”三层体系、星海图的EFM-1双系统,每一次迭代都伴随着对特定本体形态的精准适配。通用具身模型虽是一个美好愿景,但在当前阶段,模型与本体是“一对多”还是“多对多”的关系,行业尚未达成共识。腾讯试图构建一个适配所有本体的通用平台,在技术上面临极大难度,在商业上缺乏厂商配合动力。
尽管面临重重挑战,腾讯在具身智能赛道并非没有机会。其真正的价值可能不在于充当“平台统治者”,而在于成为“卖铲人”。在移动互联网时代,微信和支付宝通过生态控制力抽成;而在云计算时代,AWS和英伟达通过提供基础设施服务获利。具身智能产业的结构,可能更倾向于后者。万卡级集群训练、TokenHub推理调度、高精度仿真环境等基础设施,是单个机器人公司难以独立承担的。腾讯云在算力、仿真和数据基建层面的能力,恰恰是行业刚需。
然而,“卖铲人”与“平台统治者”是两种截然不同的商业模式。平台统治依赖于生态锁定和高毛利,而卖铲人需要持续的重投入和激烈的基础设施竞争。腾讯内部似乎已意识到纯平台策略的局限。接近RoboticsX的人士透露,“三不原则”更多是战略克制下的表态,而非长期铁律。2026年WAIC发布的EaaS(Embodied-AI-as-a-Service)模式,某种程度上正是对“卖铲人”收费模式的试探。这种转变意味着腾讯需要从“连接一切”的傲慢中走出来,接受硬件制造的复杂性,并重新校准自身在产业链中的定位。
互联网时代的成功经验,在硬科技时代往往失效。具身智能不是社交、电商或游戏,它是一个需要把“大脑”和“身体”焊在一起的物理产业。数据是每家公司的命脉,没有企业愿意将其交给平台。腾讯不做硬件、不做量产的选择本身无可厚非,但如果底层假设仍是“别人做苦活,我做平台抽成”,则可能误判形势。在这个赛道,平台的价值可能不如一把锋利的铲子,而铲子生意,从来不是躺着赚钱的。腾讯需要在算力、仿真、数据治理等底层能力上深耕,从赋能者转变为共同创造者,方能在物理AI时代找到可持续的生存空间。
未来,具身智能的竞争将从单一的技术指标转向生态系统的全方位较量。腾讯云若能将其在通用AI领域的积累,转化为针对物理世界的专用能力,如高性能仿真引擎、低延迟边缘计算节点、以及高质量合成数据生成工具,或许能在不自研硬件的前提下,构建起不可替代的基础设施护城河。但这要求腾讯放下平台的架子,深入产业一线,理解每一个关节电机的痛点,每一次感知的误差,每一次执行的延迟。只有当“连接器”真正理解“被连接物”的物理属性,连接才有意义。否则,在物理世界的重力与摩擦力面前,再完美的云端架构也只是空中楼阁。