具身智能破局:为何十亿订单背后,高质量真机数据仍是最大瓶颈?
在人工智能的演进历程中,我们往往容易沉迷于模型参数的指数级增长或基准测试榜单上的高分表现,却忽视了一个更为朴素且残酷的事实:机器人真正的进步,有时就藏在一次失败之后。当机械臂在抓取物体时滑落,当双足机器人在不平坦的地面上失衡,这些看似负面的“错误”,恰恰是通往通用智能最宝贵的阶梯。关键在于,系统是否记住了人类当时是如何介入并纠正这些错误的。
当前,具身智能(Embodied AI)正处于从技术验证向规模化落地过渡的关键十字路口。斯坦福大学发布的《2026 AI Index Report》提供了一组极具警示意义的数据:尽管机器人在高度受控的仿真操作基准中,任务成功率已高达89.4%,但一旦进入非结构化的真实家庭或工业环境,这一数字骤降至12%。这巨大的落差揭示了一个核心矛盾:互联网上海量的文本和视频数据可以轻易喂养大语言模型和视觉模型,但机器人所需的、能与物理世界发生真实交互的多模态数据,却无法通过简单的网络爬取获得,必须通过现实世界的逐条交互来生产。
在这种背景下,数据不再仅仅是模型的燃料,而是决定具身智能能否落地的基础设施。博登智能创始人兼CEO赵捷指出,行业正在重演自动驾驶早期的发展路径:初期关注本体硬件和算法模型,随后迅速意识到,数据质量、验证体系以及最终的交付能力,才是决定模型能否走出实验室、进入工厂和家庭的核心变量。目前,博登智能在手订单接近10亿元,其中具身智能业务占比已达50%,这一市场信号表明,资本和产业界正在用真金白银为“数据稀缺”买单。
从仿真到真机:跨越“Sim2Real”的鸿沟
关于具身智能数据的来源,行业内长期存在“仿真派”与“真机派”的争论。一种观点认为,随着物理引擎精度的提升,合成数据和仿真数据足以满足大部分训练需求,从而大幅降低成本。然而,赵捷提出了一个更为务实的视角:仿真和合成数据将长期存在,主要用于模型训练的底层逻辑构建和初步验证,但在最终落地环节,真机数据具有不可替代性。
如果过度依赖仿真数据,后续需要投入巨大的成本去弥补“Sim2Real”(仿真到现实)的差距,这种隐性成本往往被低估。相反,虽然真机数据的前期采集成本高、难度大,但它能让模型更快地收敛到真实物理规律上。赵捷强调,“用不上的数据才是最贵的”。评估数据价值的标准不应是单条数据的采购价格,而应是其包含的有效信息量以及对模型能力提升的实际贡献度。
具身智能所需的数据具有极高的复杂性。它不仅仅是视觉图像,还包括关节的扭矩、位置、速度,手部的触觉反馈,甚至未来可能引入的电子皮肤信号。这些多模态数据必须在时间戳上严格同步,任何微小的延迟或错位都可能导致模型对物理世界的理解出现偏差。因此,能够同时采集和处理视觉、力觉、运动状态等多维信息的自动化数据引擎,成为了行业的新基建。
失败样本的价值:人类介入即黄金数据
在数据金字塔中,位于顶层的是真机遥操作数据,尤其是那些包含人类介入行为的“失败样本”。为什么失败比成功更有价值?赵捷举了一个生动的例子:如果一个机器人连续二十次成功拿起瓶子,第二十一此失败了,此时人类介入重新拿起瓶子。这条数据不仅记录了失败的状态,更记录了人类纠正错误的路径和策略。
当模型能力进入平台期后,继续增加大量相似的成功数据,带来的边际效益递减明显。而失败数据暴露的是模型尚未解决的边界情况(Corner Cases),是人类智慧对机器盲点的补充。基于真机强化学习形成的这类训练数据,能够教会模型在什么情况下会出错,以及如何通过调整动作策略来避免错误。这种“试错-纠正-学习”的闭环,是具身智能获得泛化能力的关键。
目前,博登智能在宁波、湖州、马鞍山建成了三大具身机器人创新中心,总面积超过3万平方米,部署了500余台多型号实体机器人。这些设施并非简单的展示厅,而是高效的数据生产线。通过自产的Ego采集设备和自动化质检流程,公司实现了年产50万小时真机训练数据和百万小时级Ego场景数据的稳定产能。这种规模化的数据生产能力,正是应对行业海量数据需求的底气所在。
基础设施的重构:从外包到全链路服务
传统的AI数据服务往往被视为一种劳动密集型的外包业务,项目结束即关系终止。但在具身智能时代,数据需求是持续且动态增长的。随着新传感器的加入、新场景的拓展以及模型架构的迭代,数据标准也在不断变化。因此,数据服务商的角色必须从单一的“采集标注”向“覆盖采集、标注、训练与验证全链路的物理AI基础设施”转型。
博登智能提出的Boden Cloud体系,旨在解决这一痛点。该体系由三层构成:底层是真实世界场景网络,覆盖家庭、零售、工业等上百类场景;中间层是自动化数据引擎,通过物理一致性校验和智能流水线,将原始数据转化为可直接训练的高质量资产;顶层则是现实世界验证,确保模型在仿真中的优异表现能够转化为真实场景中的可靠性。
其中,BRIC平台负责多模态数据的采集,BASE平台利用预标注模型和人工校正提升数据处理效率,Blink平台则统一管理数据版本、算力和工作流。客户最终获得的不是孤立的数据文件,而是一个可持续迭代的数据闭环。这种平台化能力构成了新的竞争壁垒:它不仅依赖于算法软件,更依赖于复杂的供应链管理、对项目质量的严格控制以及对客户模型特性的深刻理解。
行业洗牌:泡沫退去后的生存法则
尽管具身智能热度空前,但赵捷对行业的“泡沫论”持理性态度。他认为,局部领域如世界模型(World Models)已出现严重的同质化竞争。许多公司无法清晰界定自身与世界模型其他参与者的区别,仅靠刷榜来证明能力。然而,Benchmark(基准测试)的作用正在减弱,就像两个高中生都做对了小学试卷,无法区分谁更具解决复杂问题的潜力。
未来的行业洗牌将围绕“交付能力”展开。没有实际订单、缺乏工程化落地经验、无法提供高质量验证数据的公司,将在未来两三年内面临淘汰。特别是在人形机器人领域,赵捷持谨慎乐观态度。他指出,形态并非商业化的前提,稳定性才是。在许多工业场景中,双臂机器人配合强大的视觉系统和大脑模型,可能比完整的人形机器人更早产生经济效益。
决定商业化速度的,不是机器人长得像不像人,而是它是否有明确的 tasked(任务),能否在特定场景中稳定、高效地完成工作。只有那些能够先做好一件确定之事,并通过真实场景积累数据飞轮的企业,才能建立起真正的护城河。数据飞轮的启动依赖于真实场景:模型具备初步能力 -> 进入场景工作 -> 采集失败及人类介入数据 -> 训练优化模型 -> 完成更多任务 -> 产生新数据。没有真实场景,这个循环就无法启动。
综上所述,具身智能的下半场竞争,将是数据质量与工程交付能力的较量。对于从业者而言,关注点应从单纯的模型架构创新,转移到如何构建高效、低成本、高质量的真机数据生产体系上来。毕竟,在物理世界中,每一次成功的抓取背后,都可能隐藏着无数次被记录、被分析、被学习的失败。这才是智能进化的真实轨迹。