不造身体只造大脑:谷歌如何重塑人形机器人产业格局?
从硬件内卷到智能中枢的战略跃迁
在整个人形机器人赛道陷入硬件参数军备竞赛的当下,一种截然不同的竞争逻辑正在硅谷悄然成型。长期以来,行业的主流叙事围绕着“谁拥有更完美的本体”展开。特斯拉在弗里蒙特工厂让Optimus进行高难度动作演练,Figure AI则在BotQ工厂中以小时为单位下线最新的机器人本体,并迅速攀升至数百亿美元的估值高地。这些玩家无一例外地选择了垂直整合路线:自研芯片、自研传感器、自研执行器,甚至自研底层控制算法。
然而,Google DeepMind在2026年7月30日的发布,试图彻底颠覆这一共识。其发布的Gemini Robotics 2系列模型,不再执着于制造具体的机器人硬件,而是致力于定义整个行业的“操作系统”。正如DeepMind机器人高级总监Carolina Parada所言,核心在于“从脚到指尖的智能全身控制”以及“团队协作”。这一策略的核心标语——“一个大脑,适用于任何机器人”,直击当前行业痛点:硬件碎片化严重,而通用智能缺失。
这种“不卖本体,只卖大脑”的策略,实质上是将人形机器人行业的价值链从制造端向上游智力端迁移。它不再追求单一硬件的性能极致,而是追求智能模型的通用性与兼容性。这不仅是技术路线的分歧,更是商业模式的根本重构。
三层架构:解构Gemini Robotics 2的核心能力
Gemini Robotics 2并非单一模型,而是一个分工明确、协同工作的三层架构体系。这种设计旨在解决人形机器人从感知到执行的全链路难题,涵盖了动作执行、高层推理和本地部署三个关键维度。
首先是作为执行基础的视觉-语言-动作模型(VLA)。与传统仅能控制上半身桌面作业的模型不同,Gemini Robotics 2实现了全身协同控制。它能够处理从“走向柜子”到“弯腰”再到“精确抓取”的完整长程任务流。这意味着机器人不再是一堆独立的关节堆砌,而是一个具备空间运动能力和精细操作能力的统一实体。这种端到端的控制能力,直接降低了硬件开发的软件适配门槛。
其次是作为“高级大脑”的具身推理模型(ER 2)。这是整个架构中最具战略意义的一环。ER 2不直接控制电机,而是负责理解环境、规划多步任务并调用外部工具,如Google搜索或用户自定义函数。它引入了多机器人协作机制,允许不同类型的机器人实时沟通并分工合作。例如,一个运输机器人可以规划路线,而一个操作机器人负责具体装配,二者由ER 2统一调度。这种分层架构使得复杂任务的规划能力与底层控制的实时性得以解耦,提升了系统的鲁棒性。
最后是面向边缘计算的端侧模型(On-Device 2)。针对低延迟和隐私保护需求,该模型允许在机器人本地运行。其核心优势在于快速适配能力——仅需几小时数据,即可适配全新的机器人本体。这对于硬件迭代极快的机器人行业至关重要,意味着软件更新不再受制于硬件发布的滞后周期。
平台vs.垂直:两种商业哲学的正面交锋
谷歌的这一布局,直接撞上了以Figure AI和特斯拉为代表的垂直整合阵营。理解这两者的差异,是看清人形机器人未来格局的关键。
Figure AI代表了极致的垂直整合典范。从自研Helix VLA模型到自建BotQ工厂,Figure试图掌控从算法到制造的全价值链。其逻辑在于,只有软硬件深度耦合,才能实现性能的最优化和体验的一致性。2026年7月,Figure 03累计下线突破1000台,良率超过80%,证明了其全栈能力的商业化潜力。同样,特斯拉依托其庞大的自动驾驶数据闭环和超级工厂,也在Optimus上复制了这一路径。
相比之下,谷歌选择的是一条“平台即服务”(PaaS)的道路。它不生产机器人,而是通过与Apptronik、波士顿动力等硬件厂商合作,将Gemini Robotics 2预装或适配到不同硬件上。这种模式的潜在优势在于规模效应:一旦模型被广泛接受,谷歌将成为所有机器人品牌的底层提供商,就像Android之于智能手机。
然而,风险同样巨大。Android在移动端的成功难以复制到物联网和智能家居领域,部分原因在于物理交互的复杂性远超虚拟界面。人形机器人涉及实时控制、安全约束和异构硬件驱动,任何一个环节的兼容性问题都可能导致平台体验崩塌。此外,开放API意味着主动放弃了高利润的硬件销售环节,转而依靠软件授权和服务收费。如果行业最终走向垂直整合的高溢价模式,谷歌可能沦为“为他人做嫁衣”的基础设施供应商。
开放API的双刃剑效应
在Gemini Robotics 2中,ER 2模型的开放策略尤为引人注目。谷歌通过Gemini API和Google AI Studio,允许任何开发者接入推理层。这意味着,即使没有自研VLA模型的机器人制造商,也可以利用ER 2进行高层任务规划,甚至采用“人在回路”的方式,由AI辅助人类操作员完成复杂决策。
这种开放策略极大地降低了创新门槛,但也引发了对核心竞争力的担忧。对于Figure AI等自研推理层的公司而言,当Google提供比自家Helix模型更通用、更便宜且不断迭代的API时,其自研优势可能被迅速稀释。这不仅是技术参数的竞争,更是生态垄断权的争夺。
然而,开放也有其不可忽视的优势。在物理世界中,数据的收集比算法本身更困难。通过开放平台,谷歌可以吸引更多硬件伙伴接入,从而收集更多样化的物理交互数据。这些数据反过来又会优化模型,形成“更多用户-更多数据-更好模型”的正向循环。对于硬件厂商来说,无需投入巨资研发基础AI能力,只需专注于机械结构、传感器集成和供应链优化,从而加速产品迭代。
历史的镜像:从Android到机器人操作系统
回顾科技史,谷歌的平台战略既有辉煌也有教训。Android在智能手机领域的成功,证明了通用软件平台能够打破硬件壁垒,促进产业繁荣。但当谷歌尝试将类似逻辑应用于可穿戴设备和智能家居时,却未能复制同样的统治力。
人形机器人比手机复杂数个数量级。它不仅需要处理图像和语音,还需要处理重力、摩擦力、动力学约束等物理规律。一个简单的抓取动作,可能涉及成百上千个变量的实时计算。如果平台无法解决异构硬件的驱动兼容和实时性问题,所谓的“通用大脑”可能成为“万能平庸”。
此外,安全性是人形机器人平台化最大的拦路虎。不同的硬件平台具有不同的安全特性,如何确保通用模型在各种硬件上都能安全运行,防止意外事故发生,是平台提供商必须跨越的鸿沟。相比之下,垂直整合的特斯拉或Figure,可以通过封闭系统更好地控制安全边界。
万亿市场前的终局博弈
尽管存在争议,但人形机器人市场的爆发已成定局。据Fortune Business Insights预测,全球人形机器人市场将在2034年达到1651亿美元,年复合增长率高达50.6%。从2025年的48.9亿美元起步,这一行业正经历从“实验室原型”向“基础设施”的惊人跨越。
在这场万亿级市场的博弈中,三大巨头代表了三种不同的权力结构。特斯拉和Figure AI试图成为“机器人界的苹果”,通过软硬件一体的封闭生态,提供极致体验并攫取大部分利润。NVIDIA则站在更上游,通过提供算力集群(GPU)和Isaac GR00T基础模型,成为所有玩家的基础设施供应商。而谷歌,则试图扮演“机器人界的安卓”角色,通过开放平台,让众多硬件厂商围绕其智能核心构建生态。
这场博弈的最终结局,取决于行业对“效率”与“体验”的取舍。如果硬件标准化程度提高,软件平台化成为主流,谷歌的三模型架构将占据主导地位。届时,传统的硬件厂商将沦为组装商,真正的价值创造者将是掌握智能核心的平台提供商。反之,如果硬件与软件的深度耦合成为性能提升的唯一途径,垂直整合者将继续领跑。
目前,答案尚未明朗。但谷歌敢于将最核心的推理能力开放给开发者,本身就是一种强有力的宣言。它赌的不是某一款具体的机器人,而是赌整个行业都将依赖其定义的智能标准。在这场不卖本体只卖大脑的赌局中,谷歌正在重新定义谁才是人形机器人时代的真正玩家。无论结局如何,这一战略尝试已经彻底改变了行业的竞争维度,将焦点从机械臂的运动精度,转向了智能系统的泛化能力。