XDOF三个月成独角兽:机器人数据生意为何被资本重估

4 阅读

一家“卖数据”的公司,三个月估值破百亿

2026年9月,一家成立刚满两年的公司XDOF传出新一轮融资消息,估值约12亿美元(折合人民币超百亿元)。这距离它6月宣布完成7000万美元A轮融资,仅过去三个月。

更值得注意的是,XDOF既不研发大模型,也不制造人形机器人本体。它的主营业务听起来甚至有点“土”:为机器人收集、整理和处理真实世界中的交互数据。但就是这家做“数据生意”的公司,接连拿下a16z、Thrive Capital、Lux Capital等顶级机构的投资。

在一级市场对具身智能整体趋于谨慎的背景下,XDOF的快速崛起释放出一个明确信号:随着技术路线逐渐收敛,曾经被视为人力密集、缺乏想象空间的数据环节,正在被资本重新定价。

数据不是燃料,而是训练闭环的起点

在具身智能的产业链里,常有人把机器人本体比作“身体”,大模型是“大脑”,而数据则是“燃料”。但这个比喻其实不太准确——燃料烧完就没了,而数据的价值在于能否形成持续反馈的训练闭环。

通用机器人要完成折叠T恤、开瓶盖这类任务,不能靠工程师一条条写规则。它需要从大量人类操作中学习视觉、动作、触觉之间的关联。比如抓一支笔,手腕角度差5度、力度多0.1牛顿,结果可能完全不同。这些细微差异无法靠仿真完全复现,必须通过真实交互获取。

XDOF创始人Philipp Wu在伯克利机器人学习实验室师从Pieter Abbeel教授,后者是机器人模仿学习和强化学习领域的权威。Abbeel团队早年研究物流机器人时就发现,单纯增加示范数据量反而会让模型表现变差——因为人类操作中包含大量停顿、犹豫和无效调整,这些“噪声”会被模仿学习模型当成有效信号。

WARP-RM:从无效动作里提取进展信号

今年6月,XDOF发布了WARP-RM(Warp-Augmented Relative Progress Reward Model)方案,试图解决上述问题。核心思路很巧妙:不直接判断动作对错,而是评估某个动作是否推动任务向前进展。

具体做法是,对同一段人类操作轨迹进行不同速度的“回放”。如果某个动作在加速回放后仍能保持任务推进,说明它是有效的;如果一加速就失败,则可能是冗余或错误动作。通过这种方式,一段原始示范可以生成多个带进展标签的训练样本。

实验结果显示,在折叠T恤任务中,采用WARP-BC加权训练的策略,平均用时64秒,而普通模仿学习需要114秒。更重要的是,加权策略在低质量数据集上依然保持较高成功率,说明它对噪声更具鲁棒性。

这项技术背后反映的是XDOF的产品逻辑:不做简单的数据搬运工,而是构建一套能自动识别、清洗、加权有效信号的数据处理系统。

从数据集到数据管线:商业价值的跃迁

XDOF的业务不止于卖数据集。今年6月,它公开了ABC-130K数据集,包含13万条以上双臂操作轨迹,覆盖约200个任务。但更关键的是,公司同时提供配套的数据采集工具、标注系统和训练管线。

其技术基础之一是GELLO远程操作系统——由创始团队在伯克利期间开发,允许人类通过低成本设备远程操控机器人并记录完整交互数据。这套系统解决了传统遥操作成本高、扩展难的问题,使得大规模数据采集成为可能。

投资人看重的正是这种“端到端能力”。早期的数据公司往往是项目制:客户提需求,团队组织人力采集、标注、交付。但机器人训练是持续过程——模型迭代需要新数据,换任务场景需要新数据,性能下降也要回溯补充数据。只有把采集、清洗、标注、训练、评测串成自动化流水线,才能支撑长期商业价值。

据接近交易的人士透露,XDOF年化收入已接近5000万美元,客户包括多家前沿AI实验室。这说明市场愿意为“数据+工具+服务”的打包方案付费,而非单纯购买静态数据集。

国内也在跟进,但路径略有不同

XDOF的崛起并非孤例。国内具身智能数据赛道同样升温明显。

光轮智能在2026年3月完成10亿元A++及A+++轮融资,成为全球首家具身数据独角兽;5月再获蚂蚁集团领投的新一轮融资,估值超20亿美元;6月又完成10亿元战略融资。其定位是“物理AI数据与评测基础设施”,强调数据闭环和评测标准。

另一家“智元系”企业觅蜂科技,则走硬件结合路线。今年2月从智元机器人内部孵化,截至8月底已完成数亿元融资。其MEgo无本体数据采集设备在9月实现第20000套下线,号称行业首次大规模量产此类设备。

所谓“无本体”,指的是数据采集不依赖特定机器人硬件,而是通过通用传感器阵列记录人类操作,再映射到不同机器人平台。这种设计降低了客户接入门槛,也避免了被单一硬件生态绑定。

数据质量决定智能上限

“Garbage in, garbage out.” 这句老话在具身智能时代显得尤为贴切。仿真数据可以快速扩充规模,但真实世界的复杂性——物体材质反光、接触力反馈、环境光照变化——很难完全模拟。没有高质量的真实交互数据,再强的大模型也难以落地。

当然,并非所有数据项目都能成功。部分早期尝试因技术路线未跑通而折戟,资本为此付出了试错成本。但这恰恰说明,数据的价值不在于堆量,而在于能否嵌入有效的训练反馈循环。

XDOF的快速成长表明,当行业从“讲故事”转向“看商业化能力”时,那些能提供稳定、可扩展、高质量数据生产系统的公司,会成为具身智能生态中不可或缺的基础设施。

未来竞争的关键,或许不再是“谁有更多数据”,而是“谁的数据更能驱动模型进步”。在这个意义上,XDOF们卖的从来不是数据本身,而是一套让机器人持续变聪明的方法论。