具身智能破局:为何“人”是数据闭环中不可替代的核心变量?
从“缸中之脑”到“具身实体”:产业视角的范式转移
在2026年的具身智能领域,一场静默却深刻的范式转移正在发生。过去几年,公众对机器人的记忆往往停留在翻跟头、跳舞或展台上精巧却脆弱的操作演示。然而,随着产业重心向后推移,行业关注的核心已从“机器人能做出什么动作”转向“动作数据从何而来”、“模型如何转化为本体能力”以及“失败后如何接管”。腾讯首席科学家张正友将当前的大模型比作“缸中之脑”,指出其虽具备强大的推理与生成能力,却缺乏身体感知与在动态环境中修正行动的能力。这一比喻精准地切中了具身智能的核心痛点:理解物理世界与执行物理动作之间存在巨大的鸿沟。
当前的具身智能不再仅仅是算法的堆砌,而是被设计为一套连续运行的生产系统。这套系统不直接制造某一种特定的机器人,而是持续生产数据、技能、模型以及让机器人反复迭代的能力。从人的动作捕捉、目标图像生成,到真机数据回流、分频控制与云端基础设施,具身智能正在构建一条隐藏在镜头之外的“隐形生产线”。这条生产线的效率与质量,直接决定了机器人能否从实验室走向真实的工厂、仓库乃至家庭。
数据工业化:人类经验的可扩展性困境
数据焦虑是具身智能行业长期存在的主题,但焦虑的焦点正在发生迁移。2023年时,行业面临的是通用抓取数据的匮乏;到了2026年,缺口已深入至按摩、加油、灵巧手长程精细操作等需要全身协调的物理交互场景。这种变化迫使数据生产方式从“广撒网”转向“精细化工业化生产”。
艾欧智能等头部企业将数据需求划分为预训练、后训练与运营回流三个阶段。预训练需要大规模、多场景的人类数据以建立基座能力;后训练则需要与具体本体、具体任务高度匹配的真机数据以校准偏差;而在运营阶段,现场数据必须持续回流以优化模型。在这一链条中,人类第一人称数据因其可扩展性(Scaling)而备受青睐。相比真机采集效率低下、仿真数据存在“Sim-to-Real”间隙,人类佩戴设备在真实环境中执行任务,能够以更低的边际成本获取海量数据。
然而,人类数据并非万能灵药。一段第一人称视频仅记录了视觉与惯性信息,进入训练前需重建手部位置、深度、姿态及动作语义,并映射到具体机器人,后端处理成本极高。灵初智能联合创始人陈源培指出,“10万小时人类数据,有时不如1000小时有效数据”。数据的价值不在于时长,而在于任务分布的合理性、动作的准确性以及标注的精细度。数据公司因此从单纯的“录像员”转变为“数据质检员”与“策略转化者”,动作数据开始具备工业品的属性:有原料、工艺、质检与良率之分。
跨越虚实鸿沟:世界模型与分层架构的工程智慧
将人类经验转化为机器能力,中间缺了一座桥。灵初智能将这座桥拆解为Policy模型(生成动作)与世界模型(迁移动力学、质量评估与强化学习)。世界模型在此并非宏大的未来概念,而是数据车间里的转译器与质检员。灵生科技进一步提出,世界动作模型(World Action Model)能吸收海量视频,从连续画面中学习环境变化与动作结果,其信息密度与Scaling潜力优于传统的VLA范式。
腾讯发布的RxBrain模型提供了另一种思路:同时生成目标图像,让下游动作模型不仅知道“做什么”,还能看到“做成后是什么样”。这种视觉化的目标状态为行动建立了验收标准,将失败检测前移至执行过程,填补了文字规划与物理执行之间的信息损失。然而,想象出正确终点不等于身体能抵达。张正友反对将所有能力压入同频运行的端到端模型,主张三层架构:上层负责高层认知与规划,中层以约15赫兹频率调整动作,底层以更高频率处理碰撞与失衡等反射性反应。这种频率分工用结构补偿了数据、算力与实时控制的不足。
此外,模型与本体之间的界限正在模糊。灵初早期不做整机,后因外部本体无法满足物流场景节拍,转而自研“小而全”本体,使节拍指标从90提升至450。这一案例揭示,软件能力走到现场,最终会被硬件结构定义上限。具身公司的分工因此难以长期保持整齐,全栈能力往往源于交付过程中不断暴露的缺口。
渐进式商业化:接受“不完全自主”的现实
商业化落地是检验具身智能的唯一标准,但路径并非一蹴而就。艾欧智能采取类似自动驾驶的渐进路线:机器人以20%-40%的自主能力进入现场,剩余部分由人通过遥操作或预编程补足。这种“人在回路”的方案虽不激进,却是当下更现实的起点。真实场景方往往期望机器人具备接近人的通用能力,而当前技术仅在有限任务与环境里保持稳定。接受中间状态,意味着客户需重新设计流程,将人类接管、异常处理与责任边界写入系统。
腾讯云在日化工厂实测中显示,高混合、小批量产线要求动作成功率高于95%,单次节拍快于6秒,新增SKU数据采集时间少于3天。这一指标虽具进展意义,但距离工业级99%甚至99.8%的准确率仍有工程细节构成的差距。数字智能体的经验可映照机器人落地:自主能力扩大系统可处理的问题,流程、规则与人守住交付底线。物理世界多了碰撞、损坏与人身安全,代价更高,因此“人在回路”不仅是技术过渡,更是风险控制的必要手段。
乐享科技选择直接进入家庭场景,将机器人拆分为Pet、Partner与Assistant三种属性。家庭环境充满变量:老人、儿童、宠物、杂乱物品等。乐享保留规则系统处理安全边界,用模块化模型承担感知、决策与动作,逐步向端到端演进。李元庆认为,ToC场景的Bug是未来必然遇到的,笔直走向ToC能更早积累应对复杂性的经验。张正友则强调,养老场景对安全性要求极高,触觉、力觉、视觉与本体控制必须共同工作,腾讯研发按摩机器人旨在暴露技术难题并沉淀能力,而非直接进入养老硬件市场。
云端隐形车间:数据飞轮的基础设施支撑
当行业关注数据与交付,云基础设施从幕后走向台前。具身系统需同时处理冷数据长期保存、热数据高速读取、突发清洗任务、异构芯片适配、端侧实时控制与云端复杂推理。灵初曾遭遇海量数据软链接导致性能下降,灵生面临碎片化小文件加载瓶颈,艾欧则需承接清洗、标注、格式转换与跨境遥操作网络链路。这些需求无法被简单概括为“上云”,而是需要云、边、端的精细划分。
腾讯云定位为“数字基座层”,提供存储、计算、网络、训练平台、远程操控与具身开发工具。其价值更接近机器人行业的“安卓”:通过硬件抽象层连接不同机器人,将上层规划、感知与技能与具体机器解耦。钛螺丝平台早期适配需数月,能力沉淀后缩短至数天,个别项目仅需一天。接口标准的统一成为隐形生产线的一部分,避免规模化被集成成本吞噬。
云端并非万能。最有效的数据来自真实部署,而真实部署量不足导致数据飞轮难以启动;模型可调用更大算力,但现场动作仍受网络与本体验约束;数据上传越多,隐私与可信计算要求越高。基础设施能降低摩擦,却无法替代产品找到PMF(产品市场契合点)。具身智能正在形成自己的工程体系,自动驾驶的经验可复用,但机器人面对更开放的环境,旧有工具无法覆盖从人到机器人的全部链条。
结语:在细节中构建现实
具身智能的下一步进展,未必以震撼发布出现,而更可能发生在无数不够戏剧化的细节里:有效数据多几小时、加载少等一段时间、遥操作延迟更低、某个动作成功率提高、机器人多承担一部分工作、人类少接管一次。当这些改进被组织成一条稳定的生产线,机器人或许才真正进入现实世界。具身智能的未来,属于那些能持续运营数据、模型、本体与反馈因果链的企业,而非仅追求单次Demo完美的实验者。