具身智能如何跨身体进化?维他动力提出「具身基因组」新范式
近年来,人形机器人正以前所未有的密度出现在全球各大科技展会中。从波士顿动力到特斯拉Optimus,再到中国本土创新企业,行业似乎达成一种共识:通往通用机器人的终极形态,必须是“人的形状”。然而,在这场形态竞赛背后,一个更本质的问题被悄然掩盖——造出一副人形的身体越来越容易,但装进这副身体的“智能”从何而来?

2024年世界机器人大会(WRC)上,维他动力交出了自己的答案:不仅发布了首款人形机器人 Vbot ATOM 并开启预订,更同步推出一套名为 “具身基因组”(Vbot Embodied Genome) 的技术体系。这一命名并非营销修辞,而是直指当前具身智能发展的核心瓶颈:如何让智能在不同物理身体之间实现继承与进化?

值得注意的是,ATOM并非凭空诞生。其背后站着已实现量产交付、累计运行超13万小时的四足机器人“大头”。这种从真实用户场景中积累的数据与工程闭环,构成了维他动力区别于纯算法实验室的关键优势。

智能继承:不是全盘照搬,而是分层复用

在发布会后的专访中,维他动力联创兼技术副总裁秦海龙明确指出,智能的“继承”不能一概而论,而应按功能模块进行分层处理。

首先是交互层。由于人类语言、意图表达与反馈机制不依赖于机器人本体形态,四足机器人在数万小时用户陪伴中积累的对话数据、成功/失败案例可100%直接迁移至人形平台。这意味着ATOM一出生就具备成熟的自然语言理解与响应能力。

其次是策略生成与空间理解层。无论是四足还是人形,在家庭或办公环境中执行“找水杯”“避障通行”等任务时,对空间结构、物体语义、动态障碍物的感知逻辑高度一致。维他动力采用第一人称视角(Egocentric)基模路线,结合公开数据与合成数据构建通用空间理解能力,大幅降低对特定本体真机数据的依赖。

真正存在差异的是底层运控与强化学习层。由于关节自由度、运动学拓扑、平衡约束等物理特性迥异,四足的步态控制无法直接用于人形双足行走。对此,维他动力提出“隐空间共通,末端分叉”策略:上层共享环境-身体联合状态表征,下层通过轻量化的本体适配器(Body Adapter) 将高层动作意图转化为具体关节指令。

这种架构使得ATOM的研发周期被极大压缩——从今年3月项目启动到正式发布,仅用不到半年时间。这并非技术奇迹,而是同源智能在新人形躯体上的高效验证。

真实数据稀缺的本质:不是缺专家,而是缺“问题”

当前行业普遍将操作数据稀缺归因于采集成本高,但秦海龙提出了更深刻的洞察:真正稀缺的不是专家演示数据,而是真实用户使用中产生的“问题数据”。

遥操(teleoperation)获取的数据往往展示“理想状态下该怎么做”,但现实世界充满不确定性:地面打滑、光照突变、用户临时改变指令、机械臂抓取失败……这些边缘案例和失败日志才是驱动系统进化的关键燃料。

维他动力的四足机器人“大头”已累计完成23700公里用户伴随里程,两周留存率达86%。这些终端不仅是产品,更是遍布真实生活场景的动态感知探针,持续捕获实验室无法模拟的长尾扰动。过去三个月,产品通过4次OTA更新新增31项功能,模型能力提升超30%——这正是数据飞轮高速运转的体现。

三大核心模型:构建具身智能的完整链条

为支撑“具身基因组”理念,维他动力同步公布了三大技术支柱:

Vbot-OmniDuplex:物理世界的流式全双工交互
传统语音助手依赖“说完—解析—响应”的轮次制交互,在动态环境中极易脱节。Vbot-OmniDuplex采用240毫秒微轮次对齐机制,将音频、视频、文本与传感器事件实时融合。其Thinker-Talker架构实现前后台解耦:Talker负责低延迟语音反馈,Thinker在后台进行空间感知与任务拆解。当遇到复杂指令(如“跟着我…等等,先别过来”),系统可无缝切换至深度推理模式,确保“边看、边听、边说、边干”。
Vbot-WorldModel:从生成未来到决策未来
许多世界模型止步于生成逼真视频,但对机器人而言,关键在于能否用预测指导行动。Vbot-WorldModel作为动作条件推演引擎,执行“生成—评估—优化”三步流程:策略网络输出多个候选动作;世界模型分别推演各动作下的物理未来,并从任务完成度、安全性等维度打分;优化器据此选择最优序列执行。训练数据涵盖770K+导航片段、5000公里轨迹,覆盖家庭、办公、社区等多元场景。
Vbot-EvoMorph:跨本体的策略共享与表达分化
面对“同一任务、不同身体”的挑战,EvoMorph通过统一时序编码器输出高层动作Token(如“靠近目标”“抬升姿态”),再经由本体适配器转化为具体控制指令。四足获得步态曲线,人形生成质心平衡策略,机械臂则输出抓取轨迹。这种设计使新本体无需从零训练,只需接入已有智能体系即可快速具备基础能力。
Real-Sim-Real:弥合仿真与现实的鸿沟
传统强化学习依赖Sim-to-Real路径,但物理鸿沟常导致真机表现崩塌。维他动力反其道而行,提出Real-Sim-Real闭环:
- Real→Sim:真机运行中采集接触力、打滑、延迟等遥测数据,用于精准系统辨识(System ID),并重建高保真数字孪生环境;
- Sim大规模试错:在赋予真实物理参数的仿真中,进行海量对抗训练与域随机化(Domain Randomization);
- Sim→Real:鲁棒策略部署回真机,新暴露的边缘案例再次被捕获,进入下一轮迭代。
现场展示的北京办公室数字重建场景中,四足与人形可共用同一环境资产进行规模化测试,极大提升研发效率。
终极竞争壁垒:软硬一体的工程闭环
当被问及具身智能的终极壁垒是大模型还是数据闭环时,秦海龙的回答清晰而坚定:“模型只是开始,真正重要的是让模型进入真实环境,跑通全链路闭环。”
机器人不是纯软件系统,其智能增长依赖于模型—本体—产品—场景的四重耦合。只有终端能够量产并进入千家万户,才能沉淀有价值的真机反馈;只有持续OTA迭代,才能形成能力累积效应。这考验的不仅是算法能力,更是供应链管理、硬件工程、用户体验与商业落地的综合实力。
维他动力将自身定位为“聚焦生活空间的具身智能终端公司”,其四足机器人已验证了从产品定义到规模交付的完整路径。ATOM的发布,则标志着这套能力正向更复杂的人形平台迁移。
结语:身体成为智能演化的载体
过去几年,大模型的Scaling Law围绕数据、参数、算力展开。而具身智能引入了一个全新变量:身体。如果每增加一种机器人形态,都要重建数据、模型与学习流程,行业将难以形成规模效应。
维他动力的“具身基因组”提供了一种可能:让上一副身体在真实世界中碰撞出的经验,成为下一副身体演进的起点。这不仅关乎技术架构,更是一种组织范式的转变——从追求“技术能否做到”的实验室,转向回答“能否长期稳定服务”的终端公司。
ATOM的出现,或许尚处早期,但它首次将“跨本体智能继承”这一命题,从理论图纸带入了真实物理世界。在这条通往通用机器人的路上,身体不再是终点,而是智能持续进化的载体。