具身智能数据热:45亿融资背后,“卖数据”能成百亿生意吗?
一、 具身智能的“数据饥渴”与采集乱象
在湖南郴州的一家中国移动营业厅内,挂着“具身数据采集5S店”的招牌显得尤为醒目。普通顾客只需领取一套包含夹爪、手套和头戴相机的设备,经过短暂培训,便能在做家务的过程中同步完成机器人训练数据的采集。首期投放的1000套设备,若满产运行,每年可产出100万小时数据。这种看似充满创意的“花活”,实则折射出整个具身智能行业对高质量数据近乎绝望的渴求。
这并非孤例。为了获取数据,行业出现了各种创新甚至荒诞的尝试:有的公司提供免费上门保洁服务以换取家庭环境数据,有的将数据采集封装为VR游戏,还有的通过“云操控”技术让采集员远程指挥机器人。然而,笑声背后是严峻的现实:目前没有任何一种单一的数据采集方式能够独立满足机器人复杂训练的需求。真正的挑战在于,如何高效、低成本地规模化产出符合物理规律、具备高保真度的交互数据。
二、 行业图谱:技术路线的多元博弈
据量子位对国内97家具身数据玩家的统计,其中70家专注于数据采集,27家致力于数据基础设施(Infra)建设。从技术路线来看,行业呈现出显著的多元化特征,主要分为真机遥操、无本体采集、仿真合成及互联网视频蒸馏四大类。
值得注意的是,跨路线采集已成为主流趋势。在70家数采公司中,有43%的玩家同时采用多条技术路线。例如,真机遥操结合无本体采集,或真机遥操辅以仿真数据,这种组合策略旨在应对不同场景下的数据需求。行业普遍认同“数据金字塔”理论,即机器人训练需要多层次、多模态的数据支撑,单一路线难以通吃。
1. 真机遥操:重资产下的国资优势
单独押注真机遥操路线的公司多达22家,占比31%,是单一路线中玩家最多的类别。这一群体中,13家为国资背景的数据平台,7家为机器人本体厂商。
国资平台之所以在此赛道占据主导,核心在于其“不怕重”的资源调配能力。真机遥操属于典型的重资产模式,需要购买机器人本体、租赁大型场地以及雇佣大量操作员,这些恰恰是国资平台容易调动且成本可控的资源。而机器人本体厂商则凭借硬件优势和内部需求,自然延伸至遥操数据采集环节,形成闭环。
2. 无本体采集:轻资产与新玩家的天堂
无本体采集路线由15家公司占据,其中绝大多数成立于2024年下半年,显示出极强的“具身原生”属性。该路线技术细分丰富,包括Ego视角、UMI、动作捕捉、sEMG肌电及触觉采集等。
由于无需实体机器人参与,无本体采集具有轻资产、部署灵活的特点。然而,其技术门槛在于如何将人类动作精准映射到机器人控制信号上,尤其是在力觉反馈和触觉感知方面,仍面临巨大挑战。
3. 仿真与蒸馏:理想与现实的落差
仿真合成路线的玩家仅剩2家(松应科技和谋先飞),而曾以仿真为核心的光轮智能和银河通用均已转向多路线并行。究其原因,外部真机数据和人类数据供给增加导致价格下降,削弱了仿真的成本优势;内部Sim2Real(仿真到现实)鸿沟仍未彻底解决,难以高保真还原真实世界中的摩擦、形变及触觉反馈。
互联网视频蒸馏赛道仅有枢途科技一家玩家,其宣称能将综合采集成本降至行业平均水平的千分之五。尽管成本极具吸引力,但从非结构化视频中提取高质量具身动作知识,技术难度极大,尚处于探索阶段。
三、 玩家构成:独立服务商崛起与梯队分化
若按身份分类,独立数据服务商已成为最大群体,占比40%。这表明具身数据已从机器人公司的附属部门,成长为一条独立的垂直赛道。其中,67%的玩家为“具身原生”,33%为“跨界转型”。
数据基础设施(Infra)领域吸引了大量跨界转型者,如海天瑞声、数据堂等传统AI数据标注公司。它们凭借既有的数据管线、质检流程和交付能力,迅速平移至具身数据Infra环节。相比之下,数据采集环节因缺乏现成资产,新玩家反而具备轻装上阵的优势。
1. 融资热浪下的资本冷静
在过去一年中,15家“独立具身数据服务商”(不做本体、不做模型、仅做数据)共融资约44.7亿元。尽管数字庞大,但在具身智能全行业半年融资438亿元的背景下,这一比例显得微不足道。资本的态度揭示了行业的底层逻辑:具身数据被视为“劳动力密集型”生意,具有价格内卷和低天花板的特征。
2. 明显的梯队分化
这15家融资玩家呈现出清晰的三个梯队:
- 第一梯队:光轮智能独揽31亿元,估值超20亿美元,是全球首家具身数据独角兽。其成功在于建立了标准化的数据服务流程和高壁垒的技术管线。
- 第二梯队:包括简智机器人、诺亦腾等11家公司,融资额在数千万至数亿元不等,多处于Pre-A轮及以前。
- 第三梯队:枢途科技等3家公司,融资额数千万元,处于天使轮早期验证阶段。
四、 产能瓶颈与地域布局
目前,具身数据行业年产能约为160万至180万小时。然而,短期目标是在1-3年内将产能扩大至2500万至3500万小时,增幅达15-20倍。即便目标达成,相比大语言模型(LLM)的海量语料,具身数据量仍仅为两万分之一左右。
从地域分布看,全国20个省份建有数采工厂,其中长三角地区以30座居首。国资背景的工厂覆盖16个省份,显示出政府在此领域的强力介入。无锡等城市提出“城市全域数据采集”概念,鼓励企业开放产线作为数据工厂。这种布局不仅缓解了数据短缺,也为地方经济注入了新的活力,具身数据采集正逐渐演变为AI领域新增就业岗位的蓄水池。
五、 商业闭环:谁在真正赚钱?
尽管资本热情高涨,但盈利模型尚未跑通。在15家融资玩家中,仅有弈人科技自称盈利,但未公开具体利润数据。其余公司均处于投入期,商业模式尚不清晰。
1. 价格战与规模化挑战
具身数据的本质是“卖铲人”生意。随着产能扩张,数据单价必然面临下行压力。如何在不牺牲数据质量的前提下实现规模化降本,是行业面临的核心难题。真机遥操依赖人力,边际成本递减效应弱;仿真和蒸馏虽具规模潜力,但技术成熟度不足。
2. 资本的分歧与等待
69家投资机构中,出手最多的仅3次,多数机构采取撒网策略。这种分散投资反映了行业共识的存在与标的共识的缺失。投资人既看好具身数据作为物理AI基础设施的长期价值,又担忧其短期盈利能力的不确定性。因此,当前阶段更多是等待技术突破和商业模式验证的窗口期。
六、 未来展望:验证窗口期来临
具身数据行业正处于从早期探索向规模化应用过渡的关键节点。未来一到两年将是决定生死的关键期。行业参与者需重点关注以下三个维度:
- 技术融合:单一路线难以通吃,跨路线协同、人机协作采集将成为标配。Sim2Real技术的突破可能重塑仿真数据的价值比重。
- 基础设施标准化:数据Infra公司需建立统一的数据标注、质检和交付标准,降低行业交易成本,提升数据可用性。
- 商业模式创新:单纯“卖数据”难以持续,向“数据+服务”、“数据+评测”、“数据+解决方案”转型,拓展全球市场,可能是突破天花板的路径。
总体而言,具身数据赛道虽处早期,但潜力巨大。随着机器人本体成本的下降和应用场景的丰富,数据需求将持续爆发。对于投资者和从业者而言,关键在于在喧嚣中识别真正具备技术壁垒和规模化能力的玩家,在验证窗口期内抢占先机。最终,谁能率先拿出健康的利润表,谁就能成为具身智能时代真正的“卖铲王”。