国产具身智能新突破:30%成本实现45%效率提升,WALL-B模型引领行业变革

3 阅读

国产具身智能创全球新纪录:30%成本实现45%效率提升,WALL-B模型引领行业变革

在人工智能与机器人技术飞速发展的今天,具身智能作为连接数字世界与物理世界的桥梁,正成为全球科技竞争的焦点。近日,一家名为自变量机器人的中国公司,通过一场公开直播实测,向世界展示了国产具身智能的惊人实力:在物流分拣任务中,其自研的WALL-B世界统一模型驱动双机械臂,以1816件/小时的分拣效率,超越了美国Figure AI此前公开的1248件/小时纪录,效率提升超过45%,而硬件成本仅为后者的30%。这一成绩不仅刷新了行业认知,更揭示了具身智能发展的新路径——以模型能力为核心,而非依赖昂贵的硬件堆砌。

直播实测:一小时狂拣1816件异形包裹

这场直播实测并非简单的演示,而是对机器人真实作业能力的严苛考验。在直播中,传送带上的包裹完全随机混合,包括纸盒、软袋、圆柱体、泡沫生鲜件等,形态、重量、尺寸各异,且摆放姿态随机,模拟了真实仓储环境中最棘手的工况。机器人需要在无人工干预、无固定流程的情况下,连续作业一小时,完成分拣任务。

面对如此复杂的场景,WALL-B模型展现出了卓越的适应能力。机器人首先通过视觉感知实时识别包裹的属性,包括形状、位置和姿态,然后根据这些信息动态调整抓取策略。对于轻巧规整的包裹,夹爪直接快速抓取搬运;对于大而重的箱体,则切换为双臂协同;对于夹取困难的物体,则通过侧面推移等方式稳妥处理。这种临场应变能力,在“面单整理”环节尤为突出:小件包裹借助惯性快速翻转,大件则分步调整,软包先拨动展开再校准面单。整个过程中,机器人没有重复执行同一套动作,而是根据实时情况做出最优决策。

最终,机器人以1816件/小时的有效分拣效率完成测试,准确率高达98%,全程无故障停机。这一成绩不仅远超Figure AI的1248件/小时,更是在硬件配置相对简单(双机械臂+标准夹爪)的情况下实现的,充分证明了模型能力的决定性作用。

技术解析:WALL-B模型如何突破效率上限?

WALL-B模型之所以能取得如此亮眼的表现,源于其独特的架构设计。与传统的VLA(视觉-语言-动作)模型不同,WALL-B基于世界统一模型(WUM)架构,从底层打通了视觉、听觉、语言、触觉与动作的壁垒,实现了感知、理解和执行的深度融合。这种设计消除了模块间的信息传递损耗,使机器人能够更准确地理解环境并做出决策。

具体而言,WALL-B具备三大核心能力:

  1. 原生多模态融合:视觉、语言、触觉等信息在同一网络中协同处理,机器人不仅能“看到”物体,还能“理解”其属性,并直接生成动作指令,减少了中间环节的误差。

  2. 物理规律理解与预测:模型能够理解物体间的物理关系,如遮挡、堆叠、重心等,并预测不同动作可能带来的结果。在直播中,当两个包裹叠在一起时,机器人判断直接抓取可能导致滑落,于是先分离包裹再分拣,展现了类似人类的推理能力。

  3. 零样本泛化:面对从未见过的包裹类型,WALL-B能够调用已有的物理认知和操作经验,临场组合出新的处理策略,无需针对特定物体进行专门训练。

正是这些能力,使得机器人无需依赖更复杂、更昂贵的硬件(如五指灵巧手),仅凭双臂和标准夹爪就能完成高难度任务。这标志着具身智能正从“硬件驱动”转向“模型驱动”,为规模化落地提供了更经济、更高效的路径。

行业影响:从家庭到工业,中国具身智能的通用路线

自变量机器人并非首次展示WALL-B的实力。此前,该公司已将WALL-B应用于家庭场景,让机器人在真实环境中学习与迭代。家庭环境充满不确定性,物品位置多变、材质多样、需求随机,是检验机器人泛化能力的“试炼场”。通过在家庭中的长期积累,WALL-B沉淀了丰富的物理交互经验,这些经验又迁移到工业物流场景,实现了跨场景的泛化。

这种从家庭到工业的路径,展示了通用具身智能大模型的巨大潜力。未来,随着预训练模型的持续演进,机器人或许无需针对每个场景单独开发,而是依靠不断增强的模型能力,快速适应新环境、学习新任务。这将大幅降低部署成本,加速具身智能在物流、制造、服务等领域的普及。

结语:模型能力成为具身智能竞争的核心

自变量机器人的这次直播实测,不仅刷新了行业纪录,更传递了一个重要信号:在具身智能领域,模型能力正取代硬件复杂度,成为决定性能的关键因素。通过自研WALL-B模型,中国企业在效率、成本和泛化能力上实现了对海外标杆的超越,为全球具身智能发展提供了新的思路。

当然,这只是一个开始。随着技术的不断进步,我们有理由相信,具身智能将在更多真实场景中发挥价值,而中国企业的创新实践,无疑将为这一进程注入强劲动力。