全球首个具身视频基模:蚂蚁LingBot如何重塑机器人感知闭环?

0 阅读

在人工智能的演进图谱中,视频生成技术曾长期被定义为一种数字内容的创作工具。从静态图像到动态影像,模型在画质细腻度、色彩还原及创意表达上取得了令人瞩目的成就。然而,当镜头从屏幕转向物理世界,这种技术范式便暴露出了明显的短板:生成的视频虽在视觉上逼真流畅,却往往缺乏对物理规律的严谨遵循,难以支撑机器人进行连续的运动规划与任务执行。

2026年7月9日,蚂蚁灵波开源了LingBot-Video,这一动作标志着视频生成技术从“内容创作”向“物理世界理解”的重大转折。作为全球首个基于Mixture-of-Experts(MoE)架构、专门面向具身智能的视频生成基础模型,LingBot-Video不仅重新定义了视频预训练的范式,更在推理效率、物理合理性、动作理解及任务完成度等核心维度上实现了系统性突破。它不再仅仅是一个“画笔”,而是正在成为机器人的“视觉大脑”。

从数字幻象到物理现实:评测数据背后的技术跨越

要理解LingBot-Video的突破性,首先需要审视其在标准化基准测试中的表现。在北京大学联合字节跳动发布的RBench基准测试中,LingBot-Video取得了0.620的总分。这一数据具有极高的含金量,因为RBench并非普通的视频质量评分,而是专门面向机器人操作视频的综合评测基准。它重点考察模型能否生成符合真实物理规律的行为,例如物体碰撞后的反弹角度、机械臂抓取时的力学反馈等。

在这一严苛的评测体系下,LingBot-Video超越了Wan2.6(0.607)、Seedance1.5 Pro(0.584)以及Cosmos3 Super(0.581)等主流竞品。这种领先并非偶然,而是源于其设计初衷的根本不同。以往的视频模型追求的是“看起来像”,而LingBot-Video追求的是“动起来对”。在内部benchmark的多维度评估中,面对NVIDIA Cosmos3、Wan2.2 A14B、LongCat-Video、Hunyuan Video1.5、LTX-2.3等多个开源强手,LingBot-Video在具身领域表现出的物理理解和动作一致性优势尤为明显。这表明,该模型在生成机器人相关视频时,能够更准确地保持动作过程的合理性,确保任务执行的完整性,为机器人提供了更可信的视觉反馈。

MoE架构重构:在算力与能力之间寻找最优解

具身智能对实时性有着极高的要求。机器人需要在毫秒级的时间内感知环境、预测变化并做出决策,这意味着底层模型必须具备极高的推理效率。传统的大参数密集(Dense)模型虽然在视觉表达上能力强大,但其庞大的计算量往往成为实时控制的瓶颈。

LingBot-Video在架构层面给出了创新的解决方案:采用DiT(Diffusion Transformer)结合MoE(混合专家)的设计。这一架构的核心在于“稀疏激活”机制。LingBot-Video虽然拥有30B的总参数量,但在生成视频时,仅需激活约3B的参数。这一设计巧妙地在模型容量与推理成本之间找到了平衡点。

相比同等参数规模的Dense架构,LingBot-Video实现了约3倍的推理效率提升。这意味着,在不牺牲视觉生成质量的前提下,模型能够以更快的速度响应机器人的控制指令。对于需要连续预测和规划任务的具身智能系统而言,这种效率提升是决定性的。它使得视频基础模型不再是一个离线处理的“黑盒”,而是可以嵌入到机器人的实时交互闭环中,成为感知-决策-执行链条中不可或缺的一环。

数据画像引擎:从互联网影像到具身世界模型

数据是模型智能的源泉。过去,视频生成模型主要依赖海量的互联网视频数据进行训练,这些数据虽然丰富了模型的视觉纹理和风格学习,却往往缺失了机器人所需的关键上下文信息,如物理交互、力学反馈及任务逻辑。

为了解决这一痛点,蚂蚁灵波构建了专门的数据画像引擎。LingBot-Video的训练数据不仅包含传统的互联网视频,更引入了大量针对具身智能场景定制的数据。这包括VLA(视觉语言动作)、VLN(视觉语言导航)以及第一视角(Ego)等机器人相关数据,总规模高达7万小时。这些数据覆盖了灵巧操作、机器人移动、第一视角交互等复杂场景。

通过这种垂直领域的数据注入,模型不再仅仅是学习视频表面的光影变化,而是深入学习了动作与环境变化之间的因果关系。例如,当机械臂抓取一个易碎物体时,模型学会了预测形变的幅度;当机器人在不平坦路面行走时,模型理解了重力与平衡的动态关系。这种对动作与环境交互的深刻理解,使得生成的视频不仅“好看”,更“好用”,能够为机器人提供符合物理规律的仿真数据及动作条件建模。

多维强化学习:对齐物理真实性的关键一步

架构与数据是基础,而训练策略则决定了模型的最终上限。LingBot-Video在训练过程中引入了多维强化学习奖励系统,这一机制是其实现“物理合理性”对齐的核心驱动力。

传统的视频生成训练主要依赖美学评分、Prompt跟随能力及运动一致性等常规指标。然而,这些指标无法有效约束模型生成违反物理规律的内容。LingBot-Video在此基础上,进一步将“物理合理性”和“任务完成度”纳入奖励体系。通过强化学习,模型被引导去生成那些符合真实世界运动定律、力学逻辑及任务目标的结果。

这种对齐过程使得模型能够区分“看似合理”与“物理正确”的区别。在具身智能的应用场景中,这种区分至关重要。例如,在生成机器人搬运重物的视频时,模型需要确保其姿态符合受力分析,而非仅仅生成一个搬运的动作表象。通过多维奖励系统的约束,LingBot-Video生成的视频更贴近机器人在真实世界中完成任务的需求,为后续的动作预测、仿真数据生成及世界模型研究提供了高保真的数据支撑。

结语:具身智能的基础设施新基建

LingBot-Video的开源,不仅仅是发布了一个新的模型权重,更是为具身智能产业提供了一套标准化的视觉基础底座。它清晰地划定了视频生成技术的两条演进路线:一条通向影院,服务于娱乐与内容创作;另一条通向机器人,服务于物理世界的理解、预测与交互。

未来,随着LingBot-Video在机器人动作预测、仿真数据生成、动作条件建模及世界模型研究等领域的广泛应用,我们有理由相信,具身智能的感知能力将迎来质的飞跃。当视频生成技术真正理解了物理世界,机器人将不再只是执行程序的工具,而是能够像人类一样“看懂”环境、“预判”未来的智能体。蚂蚁灵波通过LingBot-Video,正在开启这一新的历史篇章,为具身智能的落地提供了坚实的技术支撑。