具身智能数据赛道:44亿融资背后的盈利迷局与未来博弈

2 阅读

随着具身智能从概念走向落地,数据已成为制约行业发展的核心瓶颈。在湖南郴州的中国移动营业厅,一种名为“具身数据采集5S店”的新型业态悄然出现。普通顾客通过简单培训,佩戴夹爪、手套和头戴相机,在做家务的同时即可采集机器人训练数据。这种创新模式不仅降低了采集门槛,更引发了关于数据商业化前景的广泛讨论。据量子位统计,仅过去一年,15家不做本体、不做模型、专注数据的独立具身数据服务商,累计融资额高达44.7亿元。然而,面对具身智能全行业半年的223亿元融资额,这一数字显得微不足道。这背后的逻辑是什么?“卖数据”究竟能否成为一门独立的赚钱生意?

要理解这一行业的复杂性,首先需厘清数据采集的技术路线。目前主流路线可分为四类:真机遥操、无本体采集、仿真合成以及互联网视频蒸馏。真机遥操依赖人类操控真实机器人执行任务,同步采集动作与传感器数据,是重资产但高保真的选择。无本体采集则通过动捕、肌电等设备直接采集人类示范动作,无需机器人参与,具有轻资产优势。仿真合成在虚拟环境中批量生成数据,成本低但面临Sim2Real(仿真到现实)的鸿沟。互联网视频蒸馏则从公开视频中提取知识,宣称能大幅降低采集成本。值得注意的是,跨路线采集成为主流,43%的公司同时采用两种以上路线,因为没有任何单一方式能独立满足机器人训练的多元需求。

在玩家构成上,独立数据服务商已成长为最大的群体,占比40%。这一现象标志着具身数据不再是机器人公司的附属部门,而是独立赛道。进一步细分,67%的玩家为“具身原生”,多成立于2024年之后;而33%的“跨界转型”玩家,多源自AI数据标注、自动驾驶等领域,尤其在数据基础设施(Data Infra)环节占据主导。这种结构差异反映了不同背景公司的资源禀赋:原生玩家轻装上阵,跨界玩家则利用现有的数据管线和质检能力平移业务。

产能与需求的巨大缺口是该行业面临的首要挑战。目前行业现有年产能仅为160万至180万小时,而短期目标是在未来1至3年内扩大15到20倍,达到2500万至3500万小时。即便达成这一目标,对比大语言模型(LLM)所需的海量语料,仍显杯水车薪。全球高质量真实物理交互数据总量仅约50万小时,不足LLM训练数据量的两万分之一。这种供需失衡意味着数据将成为稀缺资源,但也预示着巨大的市场空间。

从地域分布来看,数采工厂已覆盖全国20个省份,其中长三角地区以30座居首。值得注意的是,无锡等二三线城市正通过开放制造业和服务业场景,打造“全域数据采集”城市名片,这不仅降低了人力成本,也为数据采集提供了丰富的真实场景。这种去中心化的布局模式,有助于缓解一线城市资源紧张的问题,并促进区域经济发展。

资本的流向揭示了行业的冷热不均。尽管总融资额达到44.7亿元,但高度集中于头部玩家。光轮智能一家公司就获得了31亿元融资,估值超20亿美元,成为全球首个具身数据独角兽。第二梯队的11家公司累计融资在数千万至数亿元之间,而第三梯队仍处天使轮阶段。更关键的是,69家投资机构中,半数仅投资一次,显示出资本对标的选择的谨慎。相较于具身模型的高想象空间,数据赛道被视为“劳动力密集型”生意,利润空间有限,且价格竞争激烈,导致没有机构敢轻易重仓。

商业模式的不确定性是当前行业最大的痛点。目前,15家独立数据服务商中,仅有弈人科技自称盈利,但并未公开具体数据。这表明“纯卖数据”的商业模式尚未经过市场验证。数据的质量、时效性以及标准化程度,直接决定了其商业价值。随着采集成本的下降和数据供给的增加,数据的边际效益可能递减,迫使企业向数据清洗、标注、评测等高附加值环节延伸。

未来一两年将是具身数据赛道的验证窗口。产能能否兑现、价格能否稳定、利润表能否出炉,将决定哪些玩家能真正脱颖而出。对于投资者而言,关注那些具备数据闭环能力、能从数据采集延伸至模型评测或物理AI基础设施的公司,或许是更明智的选择。行业仍需克服标准缺失、隐私保护、版权纠纷等多重障碍,才能构建起健康可持续的生态体系。

具身数据的本质是物理世界的数字化映射,其价值不仅在于数据本身,更在于对真实物理规律的编码能力。随着多模态大模型的发展,数据的需求将从简单的动作指令转向包含力觉、触觉、视觉等多维度的复杂交互信息。这将推动采集技术向更高精度、更丰富维度演进。同时,数据的安全性与合规性也将成为关键考量因素,尤其是在涉及个人隐私和工业机密的情况下。

综上所述,具身数据赛道正处于从“野蛮生长”向“规范发展”过渡的关键阶段。虽然资本热情尚未完全点燃,但行业的基本面正在逐步夯实。随着技术路线的收敛和商业模式的确立,具备核心数据采集能力和数据处理优势的企业,有望在新一轮竞争中占据先机。对于整个AI行业而言,具身数据不仅是机器人发展的燃料,更是构建物理世界数字孪生体的基石,其战略意义不容小觑。