具身智能数据热钱涌动:44亿融资背后,卖数据真能成金矿?

0 阅读

在湖南郴州的一家中国移动营业厅内,出现了一个颇具未来感的场景:普通顾客只需领取一套包含夹爪、手套和头戴相机的简易设备,经过短暂培训,便能在做家务的同时为机器人采集训练数据。这种被称为“具身数据采集5S店”的模式,仅仅是2025年至2026年间爆发式增长的具身数据行业的一个缩影。

据量子位最新统计,过去一年内,15家“不做本体、不做模型、只做数据”的独立具身数据服务商,共完成了约44.7亿元人民币的融资。虽然相较于具身智能“大脑派”公司上半年223亿元的融资额显得 modest,但这股资本热潮足以证明,数据已成为制约具身智能落地的核心瓶颈。行业正处在一个充满想象力与不确定性的十字路口,谁能在这一波浪潮中真正跑通“卖数据”的盈利模式,将成为决定行业终局的关键。

技术路线的多元博弈与融合

具身智能对数据的需求呈现出前所未有的复杂性,导致数据采集技术路线出现了显著的多元化特征。目前,行业主流采集方式可划分为四大类:真机遥操、无本体采集、仿真合成以及互联网视频蒸馏。

在这四种路线中,跨路线采集成为主流趋势。在统计的70家数据采集公司中,有43%(约30家)同时采用多条采集路线。这种“全都要”的策略并非偶然,而是基于“数据金字塔”理论的必然选择。没有任何单一技术路线能够独立满足机器人训练的所有需求。例如,仿真数据虽然成本低、规模大,但无法解决Sim2Real(仿真到现实)的鸿沟问题,难以还原真实世界中的摩擦力、形变及触觉反馈;而互联网视频蒸馏虽然成本极低,但存在视角偏差和动作提取的噪音问题。

具体来看,单独押注“真机遥操”路线的玩家有22家,占比31%。这一路线需要投入大量硬件本体、租赁场地并雇佣操作员,属于典型的重资产模式。因此,国资背景的数据平台在此领域占据优势,因为它们具备调动资源的能力。相比之下,机器人本体厂商选择此路线则是出于自身真实需求的自然延伸。

“无本体采集”赛道则显得更为年轻和灵活,15家玩家中绝大多数成立于2024年下半年。该路线涵盖了Ego视角、UMI、动作捕捉甚至sEMG肌电采集等丰富技术子类,主要依赖软件算法和轻量级传感器,适合快速迭代。

值得注意的是,曾经坚定的“仿真派”正在转向。光轮智能和银河通用等头部玩家纷纷增加人类真实数据采集的比重。外部原因在于真机数据和人类数据的供给增加导致价格下降,削弱了仿真数据的成本优势;内部原因则是高保真物理仿真的技术瓶颈短期内难以突破。

玩家生态:独立服务商崛起与跨界融合

若按身份分类,97家具身数据玩家呈现出明显的梯队分化。其中,独立数据服务商以39家的数量成为最大群体,占比40%。这一现象标志着具身数据已从一个附属环节成长为独立的垂直赛道。

深入分析玩家背景,67%的玩家为“具身原生”公司,33%为“跨界转型”公司。这种分布在新旧势力中呈现出有趣的反向特征:数据采集侧多为新进入者,而数据基础设施(Infra)侧则多为AI数据标注、自动驾驶等领域的转型玩家。

数据采集侧之所以被新玩家主导,是因为该环节需要从零构建数据资产,传统标注公司在此缺乏现成的方法论优势,新公司反而能轻装上阵。相反,数据Infra侧高度依赖成熟的流水线、质检标准和交付能力,这正是海天瑞声、数据堂等传统AI数据公司积累的强项,因此吸引了大量跨界玩家。

这种生态结构预示着未来的行业格局:独立服务商专注于原始数据的获取与清洗,而跨界巨头则提供底层的处理工具与标准,两者将形成紧密的供应链关系。

产能缺口与城市布局的新逻辑

尽管资本热度高企,但具身数据的产能现状与市场需求之间存在巨大鸿沟。目前,行业全行业的年产能保守估计为160万至180万小时,加上7000万至8000万条其他格式数据。然而,行业的短期目标是未来1-3年内将产出提升至2500万至3500万小时,这意味着产能需扩大15至20倍。

更严峻的是,参考大语言模型(LLM)消耗整个互联网语料的规模,全球目前高质量真实物理交互数据总量仅约50万小时,不足LLM训练数据量的两万分之一。即便行业达成短期目标,相比LLM的数据体量,具身数据仍处于“起跑线”阶段。

在地理分布上,数采工厂已覆盖全国20个省份,其中长三角地区以30座工厂居首。值得注意的是,无锡、宿迁、郴州等三四线城市正通过低成本人力和政策支持,打造“数采重镇”。例如,无锡鼓励制造业开放产线,将真实场景转化为数据采集厂。这种分布模式既反映了遥操路线对重资产基地的依赖,也体现了地方政府试图通过数据产业激活地方经济的战略意图。

资本态度:谨慎撒网与估值分化

在资本层面,44.7亿元的融资总额背后,隐藏着明显的结构性分化。15家独立服务商中,光轮智能一家独大,累计融资31亿元,估值超20亿美元,成为全球首家具身数据独角兽,占总融资额的七成。其余11家第二梯队公司融资额在数千万至数亿元不等,且多为Pre-A轮以前。

从投资机构的行为来看,69家出手的机构中,只有国方创投投了3次,其余绝大多数机构仅投了1次。这种“广撒网、不重仓”的策略,反映了市场对具身数据赛道尚缺乏共识。

具身数据被视为“劳动力密集型”生意,价格战风险高,且客户需求预期明确,天花板可见。相较于具身模型巨大的想象空间,数据业务的性感程度不足。然而,部分投资人认为其延展性在于全球化市场和模型评测基础设施的潜力。

行业终局:验证窗口的到来

综合来看,具身数据行业具备三大特征:一是独立赛道地位确立,成为AI新增就业蓄水池;二是处于早期阶段,技术与商业共识未成;三是商业模式尚未完全验证。

目前,仅有极少数公司声称盈利,且缺乏公开的利润报表。这意味“纯卖数据”是否是一门可持续的好生意,仍需时间检验。未来1-2年是关键的验证窗口:产能能否如期兑现?价格能否在竞争中维持合理利润?谁率先拿出健康的财务报表,谁就能从“卖铲人”转变为真正的赢家。

对于投资者和从业者而言,关注点不应仅停留在融资规模,更应聚焦于数据采集的质量、标准化程度以及向模型评测等下游环节延伸的能力。在具身智能的下半场,数据的质量与效率,将比数据的大小更具决定性意义。