具身智能数据战:为何人类数据正取代真机遥操作成为Scaling核心?

0 阅读

瓶颈认知的切换:当硬件红利退潮

具身智能(Embodied AI)正在经历一场从“硬件崇拜”到“数据驱动”的认知切换。过去两年,行业竞争的核心焦点集中在本体制造——谁能造出跑得更快、跳得更高的机器人硬件。然而,进入2026年,竞争的重心已不可逆转地转向了数据。这一转变并非偶然,而是由物理世界数据获取的天然壁垒所决定的。

与大语言模型拥有互联网文本、自动驾驶拥有海量路测数据不同,具身智能需要机器人学会操作物理世界。但物理世界的数据并非天然存在,它必须通过昂贵的采集手段获得。行业曾试图通过“数采工厂”解决这一问题,即通过人遥操作设备操控机器人,录制关节角度、力矩和视觉画面。然而,这种模式的成本令人望而却步:采集一条30秒的真机操作数据,成本高达10至15元;凑够大模型预训练所需的20万小时数据,需投入超过两亿元。即便如此,这20万小时对于理解物理世界规律的Scaling目标而言,仍显得杯水车薪。

与此同时,仿真数据虽能低成本生成海量“视觉+动作”配对数据,却始终受限于Sim-to-Real Gap(仿真到现实的差距)。模拟器中的物理规律与真实世界存在偏差,导致训练出的策略在真机上往往水土不服。仿真数据更适合用于预验证和补充增强,却难以承担主力数据的角色。

人类数据路线的崛起与分化

在真机数据成本高企与仿真数据精度不足的夹击下,人类数据路线逐渐从边缘走向主流。这一路线的核心逻辑在于:人类行为数据具有成本可控、采集灵活且天然覆盖广阔动作空间的优势,有望实现真正的Scaling。

业内对“人类数据”的定义和应用路径呈现出明显的分化趋势,主要形成了两条支线:

  1. 纯视觉路线:以智在无界为代表,采用第一人称视频训练模型理解人的行为语义。该路线不记录关节角度和触觉信号,成本极低且易于规模化,已积累近20万小时数据。然而,由于缺乏Duty Pose信息,无法直接恢复接触状态,因此主要用于预训练阶段的表征学习,而非直接驱动机器人。
  2. 主动传感路线:以灵初智能为代表,使用自研的62+自由度外骨骼触觉手套采集人手操作数据。该方案同时记录关节角度和指尖触觉信号,精度达到亚毫米级,处理后可等同于真机数据直接驱动机器人。虽然采集依赖专用硬件,扩张速度受限,但其数据质量高,可直接用于精细化训练。

行业验证:从边缘实验到主流共识

人类数据路线的演进脉络清晰地展示了其从边缘走向聚光灯的过程。2024年底,深度机智率先提出“人类学习”(AnthroLearning)概念,当时鲜有关注。2025年,智在无界和灵初智能分别发布基于人类视频和触觉手套的数采方案,多条支线并行推进。

真正的转折点出现在2026年初。英伟达接连发布EgoScale和DreamDojo,大规模采购和训练人类视频数据,这一全球AI算力巨头的入场成为了关键的验证信号。随后,深度机智、灵初智能、智在无界等多家公司密集发布基于人类数据的成果,包括PhysBrain 1.0、Psi-R2等。全球范围内,由前Google DeepMind研究员创立的Generalist AI也利用27万小时人类操作数据训练了GEN-0模型,首次在机器人领域观察到Scaling Law。OpenAI、Meta等巨头同样在大规模布局人类数据,方向已明确。

尽管智元机器人和宇树科技等企业仍坚持真机遥操作和仿真数据路线,侧重本体数据闭环,但人类数据路线在预训练层面的优势已得到初步验证。真机数据作为监督学习的产物,仅具备“背板能力”,泛化能力差,难以应对OOD(分布外)场景。而人类视频天然覆盖了更广阔的动作空间分布,与预训练逻辑天然匹配。

模型范式迁移:从VLA到隐式世界模型

数据路线的转变伴随着模型范式的同步迭代。过去主流的VLA(Vision-Language-Action)模型本质上是监督学习框架,受限于高质量真机数据的稀缺,无法遍历所有可行的动作空间。

行业正转向世界模型,并在显式与隐式路线间展开博弈。英伟达的Cosmos Policy采用显式路线,通过预测视频下一帧画面来预测状态变化。该方法虽然理论上可行,但需关注皮肤纹理、衣服褶皱等无关信息,成本极高。据估算,同样50小时数据,显式训练需约4000小时GPU资源,成本是隐式路线的八十倍。

相比之下,智在无界、星海图、无界动力等团队选择隐式路线(Latent World Action Model),仅建模必要的状态变化,不预测完整画面。这种路线效率差异巨大,成本大幅降低,且已在多个基准测试中展现竞争力。这一从监督学习到自监督/半监督学习的范式迁移,重演了计算机视觉领域曾经走过的路,旨在实现Scaling突破。

数据质量与处理瓶颈:量不等于质

随着人类数据规模的扩大,新的问题浮出水面:数据多了,是否意味着问题解决了?答案是否定的。行业面临的真正瓶颈已从“数据采集”转向“数据消化”。

首先,数据清洗、标注、增强和评测的工具链尚不完善。无问智科指出,数据基座应包括数据本身、配套工具链及测评体系,三者缺一不可。其次,数据处理的难度远大于采集。灵初智能技术负责人陈源培指出,10万小时人类数据在训练上的效果,可能不如精心筛选的1000小时数据。数据管线涉及视觉分割、背景修复、动作修正、策略优化等多个复杂环节,每个环节在放量时都可能成为卡点。

灵初智能从10万小时人类数据中仅筛选出约5417小时真机等效数据用于训练,这一比例揭示了数据质量的重要性。在数据集构建中,任务多样性优先于物体和场景多样性;在感知模态中,精准3D位姿优于2D图像特征。这些标准仍在研发迭代中,凸显了数据治理的复杂性。

商业化分层与资本理性回归

技术路线的演进也反映了商业化节奏的分化。行业共识逐渐形成:2B场景(工业制造、物流等)的落地速度比2C场景(家庭服务)快3到5年。优宝特机器人创始人范永用“3岁小孩”比喻人形机器人,指出其当前难以直接创造经济价值,但长期潜力巨大。

资本流向显示高度集中。2026年上半年具身智能赛道融资额约460亿元,其中70%集中在头部10家公司。投资逻辑正从共识转向差异化,宇树科技的IPO被视为行业分水岭,但其估值也将趋于理性。产业链各环节(关键模组、本体、小脑、大脑)将深耕各自领域,全栈强势的公司短期内难以出现。

结语:重新锚定具身智能的未来

具身智能行业正在经历一次深层的“重新锚定”。真机数采在精细微调阶段仍具不可替代的价值,但在预训练层面,人类数据已成为主流。这不是一场零和博弈,而是一次行业分工的重新划定:人类数据负责规模化预训练,真机数据负责精细化微调,仿真数据负责补充增强。

这一转变的速度超出多数预期。随着隐式世界模型的普及和数据处理工具的完善,具身智能有望突破Scaling瓶颈,从实验室走向更广阔的应用场景。行业参与者需保持理性,关注数据质量、工具链建设及商业化实效,共同推动具身智能从技术实验迈向产业落地。