谷歌押注机器人“大脑”:不造本体只卖API,能否重塑万亿级行业格局?

3 阅读

从“造身体”到“造大脑”的战略转向

当全球科技巨头与初创公司仍在为谁能造出更完美的人形机器人硬件而焦头烂额时,谷歌DeepMind选择了一条截然不同的路径。2026年7月30日,谷歌正式发布了Gemini Robotics 2系列模型,这一举动不仅是一次技术迭代,更是一场关于行业定义权的豪赌。与特斯拉在弗里蒙特工厂让Optimus练习跑步、Figure AI在BotQ工厂以每小时一台的速度下线Figure 03不同,谷歌站在旁边,掏出了三个模型,向整个行业抛出了一个核心命题:你们的机器人,要不要试试我的系统?

谷歌机器人高级总监Carolina Parada在官方博客中明确指出,团队正在从脚到指尖教机器人智能地控制全身、进行精细灵巧操作以及实现团队协作。与此同时,谷歌官方账号在社交平台X上抛出了更为直白的宣言:“一个大脑。适用于任何机器人。”这标志着人形机器人行业的竞争焦点,正从单一的硬件性能比拼,转向底层智能架构与操作系统的争夺。谷歌不再试图成为另一个硬件制造商,而是致力于成为机器人行业的“安卓”或“Windows”,通过提供通用的智能核心,重塑整个产业链的价值分配逻辑。

三驾马车:构建全栈式机器人智能架构

Gemini Robotics 2并非单一模型,而是一个由三个子模型组成的协同架构,分别对应动作执行、高级推理和本地部署三种核心能力。这种分工明确的架构设计,体现了谷歌对机器人智能层级的深刻理解。

首先是Gemini Robotics 2,这是一个视觉-语言-动作(VLA)模型。它的核心突破在于将视觉和语言输入直接转化为电机指令,实现了对人形机器人全身关节的完整控制。在早期版本中,谷歌的模型仅能控制上半身在桌面上进行简单操作,而新版本则赋予了机器人行走、下蹲、伸展以及复杂抓取的能力。例如,机器人可以独立完成“走到柜子前、弯腰、打开抽屉并将水壶放入绿色收纳箱”这一系列连贯动作,展现了从感知到执行的闭环能力。

其次是Gemini Robotics ER 2,这是一个具身推理模型。它不直接控制电机,而是充当机器人的“高级大脑”。该模型负责理解视频内容、解析环境信息、规划多步任务,并将执行指令下发给底层的VLA模型。其独特之处在于引入了工具调用能力,包括Google搜索和用户自定义函数,使其能够同时“思考下一步”和“执行当前动作”。更重要的是,它首次支持多机器人协作,允许不同类型的机器人在实时沟通中分工配合,完成单机器人无法胜任的复杂任务。

最后是Gemini Robotics On-Device 2,这是一个在机器人本地运行的轻量级VLA模型。它的核心价值在于快速适配能力。通过仅需几小时的数据训练,该模型即可适配全新的机器人本体。这种轻量化部署方案,解决了不同硬件平台间模型迁移成本高、实时性差的问题,为机器人行业的规模化部署提供了技术基础。

垂直整合与开放平台的路线之争

回顾整个人形机器人赛道,绝大多数玩家选择了垂直整合路线。Figure AI是最极端的代表,从2024年发布Figure 02时依赖OpenAI模型,到2025年宣布分手并转向自研Helix VLA模型,再到2025年10月亮相的Figure 03,其每一步都在强化对硬件、软件、执行器及工厂的全栈掌控。截至2026年7月,Figure已实现第1,000台Figure 03下线,并计划四年内交付10万台。特斯拉Optimus同样遵循这一逻辑,利用自研视觉AI系统、执行器及超级工厂,计划在2027年启动公共销售。

相比之下,谷歌的策略显得更为“轻资产”。它不拥有自己的机器人产线,也不销售硬件本体,而是通过与Apptronik、波士顿动力等合作伙伴合作,专注于提供“大脑”。谷歌的逻辑是:模型做一次,适配所有机器人。一个VLA模型即可直接控制Apollo 2配SharpaWave手、Apollo 2配Inspire手以及Franka Duo配Robotiq夹爪等不同形态的机器人,完成全身操控、多指灵巧操作和夹爪操作三大类任务。

这种开放策略在ER 2模型上体现得淋漓尽致。VLA和On-Device模型仅对早期合作伙伴开放,而ER 2则直接通过Gemini API和Google AI Studio向所有开发者开放。这意味着,任何开发者都可以接入该模型,为自己的机器人编写推理和规划层代码,甚至无需自研VLA,即可让人类遥控与AI决策相结合。谷歌正在将机器人行业最关键的能力——理解和推理物理世界的能力,转化为可调用的API商品。

商业逻辑的深层博弈与潜在风险

谷歌的这一策略面临着巨大的商业不确定性。如果人形机器人行业走向硬件标准化、软件平台化,那么谷歌的三模型架构将成为天选之子。三星、LG、丰田等传统硬件巨头,若缺乏自研AI能力,可直接接入Gemini Robotics,将精力集中在硬件设计与供应链上。届时,坚持全栈闭环的Figure AI和特斯拉可能面临被开放系统围剿的风险,正如当年的黑莓和诺基亚。

然而,如果行业最终走向硬件与软件深度耦合的“苹果模式”,谷歌的策略则可能失效。人形机器人比智能手机复杂得多,涉及物理交互、安全约束、实时性要求及异构硬件驱动兼容等挑战。模型再好,若无法精准控制执行器延迟、传感器精度及功耗管理,便无法提供超越原厂的体验。此外,将核心大脑做成开放API,意味着谷歌主动放弃了硬件销售带来的高额利润层。Figure AI估值390亿美元的逻辑,正是基于其掌握大脑与身体,有望吃下整条价值链。

历史经验也提供了警示。谷歌在Android手机市场的成功是平台策略的典范,但在物联网、智能家居和可穿戴设备领域,Nest和Wear OS并未复制这一成功。机器人行业的复杂性可能成为平台策略的滑铁卢。更重要的是,谷歌需要证明其On-Device 2模型在不同硬件平台上的实际适配质量与兼容性边界,目前这些数据仍缺乏详细披露。

定义技术栈:万亿市场前的最后博弈

截至2026年年中,人形机器人行业的终局尚未明朗,但竞争的本质已发生根本性变化。这不再是“谁的机器人更厉害”的比拼,而是“谁有权定义机器人行业技术栈”的博弈。Figure和特斯拉押注“硬件+软件”全栈,旨在打造伟大产品并吃掉整个市场;NVIDIA站在更上游,向所有人出售训练模型所需的GPU集群;而谷歌则押注“模型即平台”,旨在打造伟大大脑,让所有人替它造本体。

根据Fortune Business Insights预测,全球人形机器人市场将从2025年的48.9亿美元增长至2034年的1,651亿美元,年复合增长率高达50.6%。在这场从“玩具”到“基础设施”的十年跨越中,谷歌打出的三张牌共同指向一个核心:不卖机器人,卖系统;不建工厂,建标准。人形机器人行业需要的不是一个“机器人界的苹果”,而是一个能跑通的“机器人界的安卓”。

谷歌是目前唯一掏出完整三模型架构,并敢将推理层直接开放给所有开发者的巨头。它赌的是,自己的大脑能让所有的机器人都跑起来。无论这一赌局最终是胜是负,谷歌的入场已经彻底改变了人形机器人行业的竞争维度。未来,行业的赢家可能不是造出最完美机器人的公司,而是那个能让最多样机器人高效运行的智能平台。在这场牌局中,谷歌已率先亮出了它的底牌,而整个行业,正站在十字路口,等待答案的揭晓。