具身智能数据新军崛起:年融44亿背后,"卖数据"能否跑通商业闭环?

35 阅读

在具身智能浪潮席卷全球的背景下,一个看似“不够性感”却至关重要的细分赛道正在悄然爆发——具身数据采集。从湖南郴州营业厅挂牌的“具身数据采集5S店”,到各种别出心裁的“花活”数采模式,这一行业正以其独特的方式填补机器人训练数据的巨大缺口。

展示机器人处理数据、图表和信息的等距风格示意图,适用于科技或

近期数据显示,仅2025年7月至2026年7月期间,15家独立具身数据服务商便完成了约44.7亿元人民币的融资。然而,相较于具身智能“大脑派”公司半年223亿元的融资额,这一数字显得颇为 скромный(少量)。这是否意味着“卖数据”难以成为一门好生意?本文将基于对97家国内具身数据玩家的深度梳理,拆解这一行业的底层逻辑与发展现状。

一张展示机器人操作全息数据界面的插画,包含机械臂、数据图表和

技术路线博弈:跨路线成为主流

一张展示机器人正在操作键盘和全息屏幕的插画,画面中有流动的数

目前,具身数据采集的技术路线主要呈现四大分支,且相互竞争又融合。

展示服务器机房、机械臂自动化运维及数据监控的等距风格示意图,

首先是真机遥操,即人类操控真实机器人执行任务,同步采集动作、状态及传感器数据。这是目前最拥挤的赛道,单独押注此路线的玩家有22家,占比31%。其参与者主要包括机器人公司(拥有硬件优势)和国资数据平台(具备重资产投入能力,如场地、本体采购)。

一张展示人形机器人、神经网络球体和数据分析图表的科技风格插画

其次是无本体采集,人直接完成示范,通过动捕、夹爪映射、第一视角相机等设备采集数据,无需机器人参与。该路线技术最为丰富,涵盖Ego视角、UMI、动作捕捉、sEMG肌电等多种子类,成立15家公司,占比21%。值得注意的是,该路线公司极其年轻,多数成立于2024年9月之后。

第三是仿真合成,在虚拟环境中批量生成数据。早期知名玩家如光轮智能、银河通用曾坚定投入此路线,但如今纷纷转向多路线并行。原因在于真机数据和人类数据供给快速增加且价格下降,削弱了仿真的成本优势;同时,“Sim2Real Gap”(仿真到现实的差距)仍未彻底解决,难以高保真还原真实世界的摩擦、形变、力觉与触觉反馈。

最后是互联网视频蒸馏,从互联网视频中提取人类动作知识。目前仅有一家玩家枢途科技专注此路线,宣称能将综合采集成本降至行业平均水平的千分之五。

数据显示,在70家数采公司中,有30家(占比43%)同时走多条采集路线。行业通用“数据金字塔”理论指出,没有任何单一方式能独立满足机器人训练需求,跨路线采集因此成为必然选择。

玩家图谱:独立服务商成主力军

若按身份分类,97家玩家中,独立数据服务商占比最大,达39家(40%);其次是国资数据平台(26%)和机器人公司(25%)。这表明具身数据已从机器人公司的附属部门,成长为一条独立的产业赛道。

展示机器人数据服务商分类及占比的统计信息图,包含独立数据服务

进一步分析“具身原生”与“跨界转型”两类玩家:67%为具身原生,33%为跨界转型。有趣的是,数采公司多为具身原生(80%),而数据基础设施(infra)公司则多为跨界转型(70%)。后者多为从AI数据标注、自动驾驶等领域转型而来的企业,如海天瑞声、数据堂等,它们将原有的数据管线、质检和交付能力平移到具身数据环节。而数采环节因需从零构建资产,新玩家反而轻装上阵。

产能与布局:巨大的缺口与地方博弈

行业现有年产能约为160万至180万小时,以及7000万至8000万条数据。然而,行业短期目标是在未来1-3年内将产能扩大至2500万至3500万小时,即现有产能的15到20倍。

这一扩张背后的驱动力来自巨大的供需缺口。据统计,截至今年初,全球高质量真实物理交互数据总量仅约50万小时,不足大语言模型(LLM)训练数据量的两万分之一。即便短期目标兑现,相比LLM的数据量,仍刚够“起跑线”。

在地域分布上,全国20个省份已建有数采工厂,其中国资背景覆盖16省。长三角地区以30座数采工厂居首,京津冀和珠三角紧随其后。无锡等城市甚至提出“全域数据采集”概念,鼓励制造业和服务业开放场景。与此同时,人力成本较低的城市如宿迁、自贡、郴州等地也因遥操类数采工厂的散布而受益,而轻资产的无本体路线公司则更倾向于扎堆一线城市。

展示70家具身数采公司技术路线分布的统计信息图,包含真机遥操

资本视角:谨慎撒网与估值分化

展示全国数采工厂地域分布的统计表格图,包含区域、数量、占比及

在资本层面,15家独立具身数据服务商的44.7亿融资呈现出明显的梯队分化。

第一梯队由光轮智能领衔,其完成6起融资共31亿元,占总融资额七成,估值超20亿美元,成为全球首个具身数据独角兽。

第二梯队包括简智机器人、诺亦腾等11家公司,累计融资在数千万至数亿元间,多在Pre-A轮及以前。

一张展示机器人行业公司梯队分布、融资情况及代表企业的统计表格

第三梯队仅有枢途科技等3家,融资在数千万元级别,处于天使轮早期验证阶段。

令人瞩目的是,69家投资机构出手,但仅有国方创投等少数机构重复投资,绝大多数机构仅投1次。这反映出资本在具身数据赛道的谨慎态度:方向有共识,但标的无共识。相较于想象空间极大的具身模型,具身数据被视为“劳动力密集型”生意,价格战不可避免,天花板相对清晰。

展示投资机构出手次数、数量及代表机构的统计表格截图

然而,投资人也看到了延展空间:一是全球市场潜力巨大,二是数据采集能力可迁移至模型评测等基础设施环节。

商业化验证:早期阶段的生存法则

总体来看,具身数据行业仍处于极早期阶段。半数以上玩家成立不到一年,13家最新轮次在A轮及以前,且仅有弈人科技一家自称盈利但未公开利润数据。

这一现状揭示了行业的三个核心现实:

第一,具身数据已成为独立赛道,吸引大量人才涌入,成为AI领域新就业岗位的蓄水池和地方经济的新引擎。

第二,行业共识尚未完全形成,许多技术问题(如高保真Sim2Real)和商业模式问题仍未解决。

第三,资本态度最诚实。鲜有公司验证过“纯卖数据”能否长期赚钱。VC目前处于撒网阶段,无人能断言哪条路径最终胜出。

未来一两年将是关键的验证窗口。产能能否如期兑现?价格战将卷至何种程度?谁先拿出可持续的利润表,谁才能成为真正的“卖铲人”。随着机器人从实验室走向千家万户,高质量、多样化的具身数据将成为不可或缺的稀缺资源。无论技术路线如何演变,解决“数据饥渴”的企业终将在这场长跑中赢得先机。

对于投资者和从业者而言,理解数据金字塔的结构、关注跨路线采集能力的构建、以及洞察地方数采基地的政策红利,将是把握这一早期赛道机遇的关键。具身智能的下半场,不仅拼算法,更拼数据的厚度与精度。