具身智能数采变局:为何人类数据正取代真机遥操作成为主流?
数据瓶颈的破局:从真机遥操作到人类数据的范式转移
具身智能领域正在经历一场深刻的认知重构。在2024至2025年间,行业竞争的核心焦点集中在硬件本体的迭代上,各方争相打造具备更强运动能力的机器人原型。然而,随着2026年的到来,竞争的底层逻辑发生了根本性偏移:从硬件性能的比拼转向了数据规模的较量。这一转变并非偶然,而是由物理世界数据稀缺性与模型Scaling需求之间的巨大张力所驱动。
与自动驾驶拥有海量路测数据、大语言模型依托互联网文本不同,具身智能需要理解的是复杂的物理交互规律。物理世界的数据不会凭空产生,必须通过人工或自动化手段采集。长期以来,行业依赖的真机遥操作方案虽能保证数据质量,却面临着难以逾越的成本天花板。据统计,采集一条30秒的高精度真机操作数据,成本高达10至15元。若以20万小时的预训练数据为目标,仅数据采集一项就需要投入超过两亿元人民币。这一数字对于绝大多数初创企业而言是难以承受的,即便对于巨头而言,其效率也远不足以支撑模型的快速迭代。
与此同时,仿真数据曾被视为解决规模化的银弹。通过在数字孪生环境中生成海量“视觉-动作”配对数据,成本近乎为零。然而,Sim-to-Real Gap(仿真到现实的鸿沟)始终是悬在具身智能头顶的达摩克利斯之剑。模拟器中的物理规律与真实世界存在细微偏差,导致在仿真中表现优异的策略在部署到真机时往往失效。仿真数据更适合作为预验证和补充增强手段,而非主力训练数据。
正是在这种两难困境下,人类数据路线逐渐浮出水面并迅速崛起。这一路线的核心逻辑在于利用人类在长期进化中形成的运动智慧,将其转化为机器人的先验知识。由于人类数据可以通过相对低成本的视频采集获得,且天然蕴含丰富的物理交互语义,它成为目前唯一理论上具备Scaling潜力的数据源。
成本核算与路线验证:被逐一排除的可能
深入分析人类数据路线胜出的底层逻辑,并非仅因成本优势,而是基于对现有所有数据获取方式的系统性排除。灵初智能技术负责人陈源培提出的排除法论证极具代表性:互联网视频数据虽然量大,但噪声极高,清洗成本远超重新采集;真机遥操作质量最高,但受限于人力,无法覆盖无限的动作空间与场景组合;仿真数据则受限于物理引擎的精度瓶颈,且其自身的Scaling能力受限。
相比之下,人类数据兼具低成本与高扩展性。智在无界通过纯视觉路线,利用第一人称视频训练模型,已实现20万小时规模的积累。这种方案不记录复杂的关节角度和触觉信号,成本极低,但其局限性在于缺乏Duty Pose信息,难以直接恢复接触状态,因此更适合用于预训练阶段的表征学习,而非直接控制。
灵初智能则选择了另一条更具挑战的主动传感路线。其自研的62+自由度外骨骼触觉手套能够采集人手操作数据,记录亚毫米级精度的关节角度和指尖触觉信号。处理后的数据可直接等同于真机数据驱动机器人。尽管这一方案受限于专用硬件,扩张速度不如纯视觉路线,但其数据质量更高,能够支持更精细的控制任务。
这两条支线的并行推进,验证了人类数据路线的多样性与可行性。2024年底,深度机智率先提出“人类学习”(AnthroLearning)概念,主张用人类第一人称视频训练机器人。2025年,智在无界与灵初智能分别发布基于人类数据的模型,标志着多条支线开始汇聚。
真正的转折点出现在2026年初。英伟达发布EgoScale和DreamDojo数据集,分别使用1万至3万小时的人类视频数据进行训练。英伟达作为全球AI算力巨头,其大规模采购和训练人类视频数据的举动,向行业释放了强烈的信号:人类数据路线已从边缘实验走向主流舞台。随后,深度机智PhysBrain 1.0、灵初智能Psi-R2、智在无界Being-H0.7等模型密集涌现,均基于近10万至20万小时的人类数据,且在多项基准测试中取得突破。
全球范围内,前Google DeepMind研究员创立的Generalist AI也利用27万小时人类操作数据训练了GEN-0模型,首次在机器人领域观察到Scaling Law。OpenAI、Meta等巨头亦在大规模布局人类数据采购。尽管智元机器人和宇树科技仍坚持真机遥操作与仿真数据为主的路线,但行业整体风向已发生显著偏移。
模型范式迁移:从VLA到隐式世界模型
数据路线的转向并非孤立事件,它与模型范式的迭代紧密相连。过去,Vision-Language-Action(VLA)模型是具身智能的主流范式。VLA本质上是基于监督学习的框架,依赖高质量的真机数据。然而,由于真机数据覆盖的动作空间极为有限,VLA模型难以像大语言模型那样遍历所有可能的动作空间,泛化能力存在先天不足。
随着人类数据的规模化,行业开始转向世界模型(World Model)。世界模型旨在理解物理世界的动态变化,从而预测动作后果。目前,世界模型主要分为显式路线和隐式路线。
英伟达的Cosmos Policy走的是显式路线,通过预测视频的下一帧画面来模拟状态变化。这种方法要求模型关注画面中的每一个细节,如皮肤纹理、衣服褶皱等,导致计算成本极高。据估算,同样50小时的数据量,显式训练需要约4000小时的GPU算力。若扩展至20万小时,投入将达到千亿级别,这在商业上难以持续。
相比之下,智在无界采用的隐式路线(Latent World Action Model)仅建模必要的状态变化,不预测完整画面。这种隐式建模大幅提升了效率,同样50小时数据的训练成本仅为显式路线的八十分之一。星海图的LeWM隐式世界模型和无界动力的MWA™模型也在多个任务中证明了隐式路线的可行性。
这一范式迁移重演了计算机视觉领域的发展路径:从早期的监督学习起步,逐步转向自监督或半监督学习以实现Scaling突破。隐式世界模型通过减少对无关视觉信息的关注,聚焦于关键的物理交互状态,不仅降低了训练成本,还提升了模型的泛化能力和推理效率。
商业化分层与资本流向的分水岭
技术路线的演进直接影响了商业化节奏的判断。目前,行业已达成一个基本共识:2B(工业制造、物流等)场景的落地速度将比2C(家庭服务)场景快3至5年。这是因为2B场景环境可控、任务明确,更容易实现ROI(投资回报率)的正向循环。
宇泛智能CFO戴恺提出了衡量具身智能公司落地质量的三个务实指标:复购率、ROI≥30%以及经营性现金流。他指出,许多公司虽有收入,但大量款项挂在应收账款上,存在坏账风险。这种现金流的健康程度,比单纯的营收规模更能反映企业的生存能力。
对于人形机器人的未来,行业判断存在分化。优宝特机器人创始人范永将其比作“3岁的小孩”,认为短期内不应期待其直接创造经济价值,但应相信其长期成长潜力。而云松鼠智能创始人黄骏达则更为激进,预测五指灵巧手的收敛将在未来两年内见分晓,操作端的瓶颈可能比预期更快被打破。
资本的流向进一步印证了这种分化。2026年上半年,具身智能赛道融资额达460亿元,但资金高度集中于头部10家公司,早期轮次中70%的资金流向这些巨头。投资逻辑正从追逐共识转向寻找差异化。宇树科技的IPO被视为行业分水岭,市场估值趋于理性。联想之星合伙人高天垚指出,投资者更看重项目的技术壁垒与差异化优势,而非单纯的硬件堆砌。
范永则从产业链角度指出,关键模组、本体、小脑、大脑等环节均有深耕空间,但全栈强项的公司短期内难以出现。未来三五年,能将营收跑起来的更可能是本体企业,因为“大脑最终要附生到本体上才有落地的市场”。
数据质量大于数量:工具链与评测体系的缺失
当数据量突破十万小时大关,新的问题随之浮现:数据不等于能力。无问智科创始人刘盛翔指出,行业缺的不仅是数据,更是整套的工具链和测评体系。正如没有CUDA生态,再强的GPU也无法发挥性能一样,缺乏高效的数据处理与评测框架,海量数据将沦为数字垃圾。
灵初智能技术负责人陈源培提出了一个反直觉的观点:10万小时的低质数据,可能不如1000小时的高质数据。他举例说明,若将任务发散至1000个任务各采100小时,其训练效果可能等同于1000个任务各采1小时。关键在于数据的多样性与代表性,而非单纯的时长堆积。
数据处理的难度远超采集。灵初智能的数据管线涉及视觉端的手部分割、背景修复、机器人模型渲染,以及动作端的世模修正、强化学习策略优化等环节。每一个环节在处理少量数据时均可行,但一旦放量,每个环节都成为卡点。
在数据集构建中,任务多样性优于物体多样性,物体多样性优于场景多样性。在感知模态上,精准3D位姿重于触觉模态,触觉模态重于2D图像特征。灵初智能虽采集10万小时人类数据,但仅筛选出约5417小时真机等效数据用于训练,这揭示了数据质量对模型性能的决定性影响。
结语:重新锚定的行业未来
具身智能行业正经历从硬件竞赛向数据基建的深层重构。真机数采在精细微调阶段仍具不可替代的价值,但在预训练层面,人类数据凭借其成本优势与Scaling潜力,已成为主流选择。这并非零和博弈,而是行业分工的重新划定:人类数据负责宏观表征与泛化能力构建,真机数据负责微观交互与精准控制。
随着隐式世界模型等技术路线的成熟,数据获取的成本将进一步降低,效率持续提升。然而,真正的瓶颈已从数据采集转向数据治理与工具链建设。谁能率先构建起高效的数据清洗、标注、增强与评测体系,谁就能在具身智能的下半场竞争中占据先机。
行业共识正在形成,但非共识的差异将决定企业的长期价值。在资本理性回归与技术快速迭代的背景下,具身智能正从概念验证走向规模化落地。这一过程充满挑战,但也孕育着巨大的创新机遇。对于从业者而言,理解数据背后的物理规律,构建适配的算法范式,以及打造可扩展的商业闭环,将是穿越周期、赢得未来的关键。