具身智能数据范式重构:为何人类视频正在取代真机遥操作?

2 阅读

具身智能(Embodied AI)正在经历一场从“硬件本体”向“数据底座”的深刻认知切换。过去两年,行业聚光灯始终聚焦于机器人的本体制造——谁能造出更灵活、更耐造的人形机器人。然而,随着2026年的到来,竞争的重心已悄然转移。大语言模型拥有互联网文本的海量滋养,自动驾驶有多年积累的路测数据闭环,但具身智能面对的是一个截然不同的难题:物理世界的数据不会天然存在,且采集成本极高。

真机遥操作的Scaling死结

长期以来,真机遥操作被视为获取高质量数据的标准路径。人类通过遥操作设备操控机器人,记录下每一帧的关节角度、力矩和视觉画面。这种方式虽然能产生高保真数据,但其经济账却令人望而却步。

据行业测算,一条仅30秒的真机操作数据,采集成本高达10至15元。若以1小时数据为单位,成本约为1000元。要凑够大模型预训练所需的20万小时数据,预计需投入两亿元以上。相比之下,Meta前首席科学家杨立昆提出的V-JEPA框架,仅靠100万小时视频就构建了强大的视频自监督学习模型,且成本远低于真机采集。这一巨大反差揭示了真机数采在Scaling(规模扩展)层面的根本困境:它无法通过简单的线性投入获得指数级的数据增长。

仿真数据的局限与人类数据的崛起

为突破真机成本瓶颈,行业曾大量依赖仿真数据。在模拟器中,机器人可以无限次尝试任务,数据成本几乎为零。但Sim-to-Real Gap(仿真到现实的差距)始终存在。物理引擎的偏差导致训练出的策略在真机上往往水土不服,仿真数据更适合做预验证,而非主力数据源。

转折点出现在对“人类数据”价值的重新发现上。人类数据由于采集成本可控、场景覆盖灵活,展现出极强的Scaling潜力。这并非否定真机数据的价值,而是明确了数据分工:人类数据负责预训练阶段的大规模表征学习,真机数据则退居后方,服务于精细微调。

这一路线的演进脉络清晰可见:2024年底,深度机智提出“人类学习”路线;2025年,智在无界与灵初智能分别通过纯视觉和主动传感(外骨骼触觉手套)两条支线并行推进;2026年初,英伟达发布EgoScale和DreamDojo,标志着全球AI巨头对这一路线的集体验证。至此,人类数据从边缘实验走向主流预训练标准。

模型范式的迁移:从VLA到隐式世界模型

数据路线的转向,同步推动了模型架构的升级。VLA(Vision-Language-Action)作为过去的通用范式,本质是监督学习框架。其局限在于,高质量真机数据无法覆盖全量的动作空间,导致模型泛化能力受限。一旦遭遇分布外(Out-of-Distribution)场景,性能急剧下降。

行业正加速向“隐式世界模型”迁移。与英伟达Cosmos Policy预测完整画面帧的“显式”路线不同,隐式路线(如智在无界的Latent World Action Model)仅建模必要的状态变化,忽略无关视觉细节。这种策略带来了数量级的效率提升:同等数据量下,隐式训练的GPU成本仅为显式的八十分之一。当训练规模扩展至20万小时,显式路线的投入将高达千亿级别,而隐式路线则具备商业可行性。学术界如星海图的LeWM、产业界如无界动力的MWA™,均在验证这一低成本、高泛化的技术路径。

数据质量的悖论:量不等于质

尽管人类数据路线打通了供给端,但“消化”端仍面临严峻挑战。无问智科创始人刘盛翔指出,行业缺的不仅是数据,更是配套的工具链与测评体系。如同没有CUDA生态的GPU无法发挥算力,缺乏清洗、标注、增强流程的数据只是一堆垃圾。

更深层的问题在于数据的有效性。灵初智能技术负责人陈源培提出一个反直觉观点:“10万小时人类数据,有时不如1000小时。”若为凑数据量而重复采集低多样性的任务,其训练效果远不及覆盖1000个不同任务的1000小时数据。灵初智能采集的10万小时人类数据,经复杂管线(视觉分割、背景修复、动作修正)处理后,仅筛选出约5417小时高价值真机等效数据。

这揭示了数据处理的真实难度:任务多样性 > 物体多样性 > 场景多样性。精准的3D位姿与触觉模态,比粗糙的2D图像特征更具训练价值。行业共识正在从“追求数据规模”转向“追求数据密度与结构质量”。

商业化分层与资本理性

技术路线的演进,最终映射在商业化节奏与资本流动上。目前,行业形成明确共识:2B场景(工业制造、物流)的落地速度将领先2C场景(家庭服务)3至5年。宇泛智能CFO戴恺提出衡量落地质量的三项硬指标:复购率、ROI≥30%、经营性现金流健康。

资本流向呈现出高度的结构性分化。2026年上半年,具身智能赛道融资约460亿元,但70%资金集中在头部10家公司。这种集中反映了投资者对“差异化技术壁垒”的渴求,而非盲目跟随共识。宇树科技的IPO被视为行业里程碑,但市场对其估值逐渐回归理性。正如业内观点所言,人形机器人如同3岁孩童,短期内难以通过“打工”变现,其核心价值在于本体的物理基础与大脑的智能协同。

结语:重新锚定未来

具身智能行业正经历一次深层的“重新锚定”。真机数采并未消亡,而是在产业链中找到了更精准的位置——作为微调阶段的黄金标准;人类数据则凭借低成本与高扩展性,成为预训练的主流基石。这场变革不仅关乎数据获取方式的优化,更涉及从监督学习到自监督/半监督学习的范式跃迁。

未来三到五年,产业链上的关键模组、本体、小脑(运动控制)与大脑(决策规划)将各自深耕。那些能够构建高效数据工具链、实现隐式模型低成本训练、并在2B场景率先跑通商业闭环的企业,将在这一轮分化中胜出。具身智能的下半场,不再是单纯的本体竞赛,而是数据质量、模型效率与商业落地能力的综合较量。