Google发布具身推理模型:机器人能否摆脱Android式垄断神话?
机器人进化的关键转折点
在具身智能(Embodied AI)这片充满想象力的蓝海中,Google并未选择像传统硬件厂商那样亲自下场制造人形机器人,而是采取了一种更为隐蔽且具备颠覆性的策略。2026年7月30日,Google正式开放Gemini Robotics ER 2预览版,这一举动在科技界并未引发如新品发布般的轰动,却在开发者社区激起了深层的涟漪。
与以往展示炫酷机器人动作不同,此次更新直接体现在Google AI Studio及Gemini API的控制台界面中。开发者面对的不再是具体的机械臂或轮式底盘,而是两个新的模型端点:一个面向常规具身推理任务,另一个则专门针对实时音视频流和低延迟机器人智能体。这种“软件定义硬件”的思路,清晰地将Google的战略定位从内容生成工具延伸到了物理世界的控制中枢。
Google正在复制其在移动时代的成功路径:通过Android系统连接应用、芯片和终端,在PC时代通过Chrome和Android占据入口。而在具身智能时代,它试图占据连接模型、本体和工具的中间位置。这一次,它争夺的不再是屏幕上的流量,而是机器人执行任务时的“决策权”。
重新定义机器人的“大脑”
要理解ER 2的价值,首先需要厘清具身智能领域的技术分层。传统的视觉-语言-动作(VLA)模型主要解决的是“手脚怎么动”的问题,即如何将视觉感知直接转化为电机控制信号。然而,在复杂的真实世界中,仅仅知道如何移动关节是远远不够的。
Google将Gemini Robotics系列划分为两个层次:VLA模型负责底层动作执行,而ER(Embodied Reasoning,具身推理)模型则扮演“高层大脑”的角色。当用户下达“收拾桌面”的指令时,ER模型需要完成一系列复杂的认知任务:识别桌面上的物体、理解物品之间的空间关系、判断哪些物品需要移动、制定先后顺序,并将具体的执行指令拆解后发送给底层的抓取模型或运动规划器。
ER 2相较于前代版本的核心突破,在于从静态的任务规划转向了动态的执行循环。它建立在Gemini 3.5 Flash架构之上,新增了视频片段定位、任务进度分类以及多步骤工具调用能力。这意味着模型不再仅仅是处理单张图片,而是能够连续观察视频流,判断动作的开始、执行进度以及是否成功。
这种能力的提升对于解决机器人在物理世界中的“规划-执行脱节”问题至关重要。在理想环境中,机器人可以完美执行预设程序,但在现实场景中,杯子可能滑动,箱子位置可能偏移。ER 2通过持续的环境观察和反馈,使机器人具备了一定的“自我修正”能力,从而在动作过程中动态调整策略。
开放API背后的商业野心
尽管被称为“大脑”,ER 2在技术架构上有着明确的边界。它接收文本、图像、视频和音频输入,但输出依然是文本或结构化数据,如物体坐标、任务步骤和工具调用指令,而非直接的电机控制信号。这一设计并非技术缺陷,而是Google深思熟虑的战略选择。
Google并未试图用一个端到端的大模型包办从感知到执行的所有环节。相反,它将自己定位为一种“调度系统”或“中间件”。这种架构极大地降低了不同形态机器人的接入门槛。机器人行业目前缺乏统一的硬件标准,人形机器人、双臂机械臂、四足机器人在关节数量、负载能力和控制频率上差异巨大。如果Google试图为每种本体训练专用模型,其成本和复杂性将难以承受。
通过高层推理与底层控制的解耦,Google希望证明,只要机器人具备可调用的控制接口,Gemini ER 2就能成为它们的通用任务入口。这种策略使得ER 2能够覆盖从ALPHA双臂平台到Apptronik人形机器人的广泛生态。对于机器人制造商而言,这降低了自研大模型的压力;对于Google而言,这使其能够以极低的边际成本进入广阔的物理世界市场。
此外,ER 2首次突出了多机器人协同能力。在仓储、工厂等复杂场景中,任务往往需要移动机器人、机械臂、固定摄像头等多种设备配合完成。ER 2作为“机器人智能体编排器”,能够理解整个任务的进度和依赖关系,将自然语言指令转化为多台设备可执行的动态流程。这一能力直击工业自动化的痛点:传统自动化系统难以低成本应对频繁变化的任务,而基于大模型的调度系统则具备更强的灵活性。
现实挑战与数据边界
然而,将大模型引入物理世界并非没有风险。Google在官方开发文档中毫不避讳地指出了当前模型的局限性。复杂请求和高分辨率输入会增加推理延迟,模型可能产生“幻觉”,空间输出的准确性也受光照和提示词质量影响。对于高精度任务,Google甚至建议开发者通过多次调用并取平均值来提高可靠性。
在聊天场景中,回答错误可能只是体验不佳;但在物理世界中,幻觉可能导致机械臂碰撞、物品损坏甚至人员受伤。此外,ER 2目前仍处于预览阶段,缺乏在真实商业场景中长期运行的验证数据。其在连续工作数小时、面对陌生环境时的稳定性,仍需机器人企业进行严格测试。
更深层的挑战在于数据隐私与部署成本。机器人在运行过程中会持续采集音频、视频和个人行为数据。Google已在开发者条款中明确要求,运营方需获得相关人员同意并最小化数据采集。在工厂等敏感场景中,企业是否愿意将生产视频和任务数据持续上传至云端模型,将直接影响ER 2的商业化速度。许多企业可能更倾向于本地化部署,但这与Google基于云端API的服务模式存在潜在冲突。
产业链格局的重塑
Google的开放策略正在重塑具身智能行业的竞争格局。过去两年,中国具身智能企业普遍强调“全栈自研”,从本体、关节到世界模型和VLA模型,完整的技术链条被视为估值的重要支撑。ER 2的推出迫使市场重新思考这一叙事的有效性。
当通用的空间理解、任务拆解和工具调用能力可以通过API获取时,机器人企业是否仍有必要从头训练相似模型?答案取决于企业的核心壁垒所在。对于缺乏模型团队的本体厂商,调用基础模型可以降低进入门槛,快速验证产品;但对于拥有大量场景数据和客户资源的企业,通用模型可能只是加速器。
外部模型无法替代企业对负载、速度、功耗和安全边界的工程理解,也无法天然掌握特定产线多年积累的工艺数据。随着基础模型能力成为公共供给,机器人企业的价值将更多地体现在本体制造、场景适配和数据积累上。对于中国企业而言,丰富的制造业场景和真实的物理交互数据仍是难以复制的筹码。
下一块计算界面的争夺
从搜索、智能手机到生成式AI,Google长期争夺的都是人与计算系统之间的入口。机器人被视为下一块重要的计算界面。当计算从屏幕走向物理空间,用户不再通过点击图标调用服务,而是直接说出目标,由机器人观察环境并完成任务。谁掌握这层理解和调度能力,谁就可能影响未来机器人如何连接搜索、地图、云服务和其他数字工具。
ER 2已支持Google搜索、函数调用和代码执行能力,使机器人具备先查找信息、再结合环境制定方案的能力。Google真正想连接的,不仅是某一台机器人,而是数字世界和物理世界之间的调用链。
尽管距离真正的通用机器人“大脑”仍有距离,但Google已经给出了其选择:不亲自下场制造硬件,而是站在本体之上,提供观察、判断和调度能力。一旦这种分工确立,机器人企业负责制造“身体”,Google则试图定义“大脑”如何理解世界。在智能手机时代,Android让Google无需生产手机也能占据核心位置;在物理智能时代,Google希望复制的或许不是产品形态,而是那套熟悉的商业逻辑:掌握最重要的软件入口,从而掌控整个生态的脉搏。
这一战略能否成功,不仅取决于技术的成熟度,更取决于它能否在安全性、隐私保护和成本控制之间找到平衡,以及能否真正赢得机器人制造商的信任,将其嵌入到日益复杂的自动化系统中。