Gemini Robotics 2:赋予机器人全身智能,迈向通用物理AI新纪元

1 阅读

从单一任务到通用智能:机器人技术的范式转移

长期以来,机器人技术一直受限于预编程和远程操作的框架,只能在高度结构化的环境中执行重复性任务。这种模式缺乏对未知环境的适应能力,更无法实现技能的跨平台迁移。然而,随着人工智能技术的飞速发展,特别是多模态大模型的突破,我们正站在机器人技术范式转移的临界点上。谷歌DeepMind最新发布的Gemini Robotics 2系列模型,正是这一变革的先锋,它试图为各种形态的机器人注入真正的“思考”与“行动”能力,使其能够安全、智能地融入人类世界。

一张展示白色机器人头部特写的照片,背景为模糊的工业或仓储环境

Gemini Robotics 2:三大模型构建智能核心

Gemini Robotics 2并非单一模型,而是一个由三个高度专业化模型组成的智能体系,每个模型都针对机器人能力的不同维度进行了优化。

Gemini Robotics 2:全身控制的视觉-语言-动作模型

作为系列中最先进的视觉-语言-动作模型(VLA),Gemini Robotics 2的核心能力在于将视觉和语言输入直接转化为电机控制指令。它首次实现了对完整人形机器人的控制,从脚趾到指尖,覆盖全身动作。这意味着机器人能够执行需要协调全身平衡、移动和操作的任务,例如在杂乱环境中行走、蹲下、伸展并拾取物品。此外,该模型在双手和夹爪的精细操作方面也取得了显著进步,能够处理诸如系绳结、密封拉链袋等需要高度灵巧性的任务。

一张白色人形机器人手持彩色物体的特写照片,展示了机器人的外观

Gemini Robotics ER 2:具身推理的“大脑”

汽车空调维修用的 manifold gauge set(歧管

如果说VLA模型是机器人的“小脑”,负责具体的动作执行,那么Gemini Robotics ER 2则扮演着“大脑”的角色。这是一个具身推理模型(ER),本质上是一个视觉语言模型(VLM),它使机器人能够理解物理世界、与人类沟通,并规划长达数分钟的多步骤任务。ER 2模型引入了任务开始和结束的感知能力,能够精确识别关键事件发生的时间点,从而更好地跟踪任务进度。更重要的是,它支持多机器人协作,使不同类型的机器人能够相互通信、协同工作,完成单个机器人无法独立完成的复杂工作流。

展示Gemini Robotics ER 2机器人及其视觉感

Gemini Robotics On-Device 2:端侧智能的快速适应

许多实际应用场景要求机器人具备低延迟和离线运行能力,Gemini Robotics On-Device 2正是为此设计的。作为最高效的VLA模型,它能够在机器人设备上本地运行,无需依赖云端计算。该模型继承了Gemini Robotics 1.5的“运动迁移”技术,能够以极快的速度适应全新的机器人本体。实验表明,仅需数小时的适应时间和不到200个示例,它就能适应具有不同形状、传感器和自由度的新型双臂机器人,这为机器人技术的规模化部署提供了关键支撑。

展示多个机械臂在不同场景下(如整理书架、下棋、操作电脑、厨房

技术突破:全身控制、精细操作与多机器人协作

Gemini Robotics 2的发布带来了三项核心技术的显著突破,这些突破共同推动了机器人能力的边界。

全身控制:从桌面任务到复杂环境

以往的人形机器人控制模型多局限于上半身,只能完成桌面上的简单操作。Gemini Robotics 2则首次实现了对整个人形机器人的控制,将AI的物理智能扩展到全身运动。例如,在演示中,Apptronik的Apollo 2人形机器人能够根据指令“将浇水壶放入底层货架的绿色箱子中”,自主完成行走、拾取、移动和放置等一系列动作。尽管机器人的移动速度仍有待提升,但这标志着机器人具备了在真实世界复杂环境中执行全身协调任务的能力。

一张展示FTTRONIK品牌人形机器人在圆桌前进行积木抓取或

精细操作:从夹爪到灵巧手

机器人的实用性很大程度上取决于其操作能力。Gemini Robotics 2在精细操作方面取得了长足进步,无论是使用多指灵巧手还是标准两指夹爪,都能执行复杂的任务。例如,它能够控制具有22个自由度的SharpaWave五指手完成系绳结、密封拉链袋等精细动作,也能操作Franka Duo平台上的两指夹爪进行紧密包装。虽然多指灵巧操作仍具挑战性,但这一进展无疑为机器人在家庭和工业场景中的应用打开了新的大门。

多机器人协作:团队合作解决复杂问题

真实世界的任务往往需要多种技能和资源,单个机器人难以独立完成。Gemini Robotics ER 2引入了多机器人协作能力,使不同类型的机器人能够组成团队,共同完成复杂的工作流程。例如,一个负责搬运,另一个负责组装,它们通过通信和协调,实现效率最大化。这种协作能力是迈向通用物理AI的关键一步,因为许多现实问题本质上需要团队合作。

安全与责任:构建可信赖的机器人

随着机器人能力的增强,安全性成为首要考量。Gemini Robotics 2在安全方面采取了多层次的防护措施,结合传统的物理安全手段和先进的AI安全框架。

ASIMOV-Agentic基准:衡量智能体的安全决策

为了评估具身推理智能体的安全行为,谷歌推出了ASIMOV-Agentic基准。该基准测试智能体在不确定情况下拒绝不安全工具调用的能力,以及预测任务可行性并主动请求人类干预的能力。这确保了机器人在面对模糊或危险情境时,能够做出负责任的选择。

增强的具身推理:更安全的人机交互

Gemini Robotics ER 2在安全约束遵循和人类接近检测方面表现优异,是谷歌迄今最安全的机器人模型。它能够实时检测人类是否靠近,并在必要时触发安全工具调用,使机器人安全停止。这符合协作安全标准,为机器人在人类环境中工作提供了保障。

未来展望:迈向通用物理AI

Gemini Robotics 2的发布是机器人技术发展史上的一个重要里程碑,它展示了将多模态理解与具身智能结合的巨大潜力。然而,通往通用物理AI的道路依然漫长。当前模型在处理极端复杂任务、提升运动速度和精度方面仍有提升空间。此外,如何确保机器人在各种未知环境中的鲁棒性和安全性,也是未来研究的重点。

尽管如此,Gemini Robotics 2所代表的技术方向——即构建能够思考、行动并与人类协作的通用智能体——无疑是正确的。随着模型的不断迭代和硬件成本的降低,我们有理由相信,机器人将在不久的将来成为我们日常生活和工作中不可或缺的伙伴,共同应对全球性的挑战。