具身智能新突破:LingBot-Video如何用MoE架构重塑视频基模?

0 阅读

从数字幻象到物理现实:具身智能视频生成的范式转移

视频生成模型在过去几年中经历了爆发式增长,其核心驱动力主要围绕画质提升、帧率流畅度以及创意表达的丰富性。然而,这种演进路径在面向数字内容创作时表现优异,却在触及物理世界时遭遇了瓶颈。对于具身智能(Embodied AI)而言,仅仅生成“看起来逼真”的视频是远远不够的。机器人需要在连续的时间序列中理解物理规律、预测物体运动轨迹,并据此规划执行路径。如果一个生成模型无法保证动作的物理合理性,或者在时间维度上出现逻辑断裂,它将无法支撑机器人进行可靠的连续预测和控制闭环。

这一行业痛点揭示了视频生成技术的两个分化方向:一条通向高保真的内容创作领域,服务于影视与娱乐;另一条则通向严肃的物理世界交互领域,服务于机器人的感知与决策。蚂蚁灵波近期开源的LingBot-Video,正是针对后者的一次系统性探索。作为全球首个基于Mixture-of-Experts(MoE)架构、面向具身智能的视频生成基础模型,它不仅在架构设计上进行了重构,更在数据构建和训练目标上引入了全新的范式,试图解决视频模型“懂画面不懂物理”的核心难题。

性能验证:在物理一致性上的系统性超越

要评估一个视频模型是否真正具备服务于具身智能的能力,传统的画质评分已失效,必须引入针对机器人操作行为的综合评测。在北京大学联合字节跳动发布的RBench基准测试中,LingBot-Video取得了0.620的总分,这一成绩明确超越了Wan2.6(0.607)、Seedance1.5Pro(0.584)以及Cosmos3Super(0.581)等主流开源模型。

RBench的核心价值在于其对“真实物理规律”的严格考量。该基准重点考察模型生成视频时,机器人行为是否符合力学逻辑、动作过程是否连贯、任务执行是否完整。LingBot-Video在此榜单上的领先,表明其在生成机器人操作视频时,能够更准确地保持动作的物理合理性。例如,在抓取、倾倒或移动物体等场景中,模型生成的视频不仅视觉上流畅,更在力学约束下保持了物体与环境的交互一致性。

此外,蚂蚁灵波在内部基准测试中,从通用质量和具身领域两个维度对LingBot-Video进行了全方位评估。对比NVIDIA Cosmos3、Wan2.2A14B、LongCat-Video、Hunyuan Video1.5以及LTX-2.3等五个顶级开源模型,LingBot-Video在具身相关场景中展现出显著优势。这种优势并非体现在单纯的视觉美感上,而是体现在对物理世界变化的建模能力上。它证明了该模型能够理解动作与环境变化之间的因果联系,而不仅仅是学习视频表面的纹理变化或风格迁移。

架构创新:MoE带来的效率与能力的平衡

具身智能对模型推理效率有着极为严苛的要求。机器人需要在实时交互中快速处理视觉信息并生成预测,传统的密集(Dense)架构虽然参数规模大,但全量计算带来的延迟和能耗往往难以适应实时控制闭环。

LingBot-Video在架构层面做出了关键抉择:采用DiT(Diffusion Transformer)结合MoE(Mixture-of-Experts)的设计。在这一架构中,MoE机制被引入以替代传统的Dense结构。其核心逻辑在于“按需激活”。LingBot-Video拥有30B的总参数量,这意味着它具备处理复杂视觉场景和深层物理逻辑的强大潜力。然而,在每次推理生成时,模型仅激活约3B的参数。

这种稀疏激活机制带来了约3倍的推理效率提升,相比同等参数规模的Dense架构,极大地降低了单次生成的计算成本。这一设计巧妙地平衡了模型容量与推理效率之间的矛盾:既保留了大规模参数带来的高保真视觉表达能力和复杂的逻辑理解能力,又满足了具身智能对低延迟、高吞吐量的实时交互需求。对于需要频繁进行动作预测和规划迭代的机器人系统而言,这种效率提升是直接且决定性的。

数据重构:从海量互联网到具身专用图谱

模型能力的上限由数据决定。过去的视频生成模型主要依赖互联网上公开的海量视频数据进行预训练,这些数据虽然丰富,但大多缺乏对物理交互的精细标注,且包含大量与机器人操作无关的娱乐或艺术内容。

LingBot-Video在数据构建上引入了“数据画像引擎”,对数据源进行了彻底的重构。在保留部分通用互联网视频以维持基础视觉理解力的基础上,模型大规模引入了VLA(Vision-Language-Action)、VLN(Vision-and-Language Navigation)以及Ego(第一视角)等机器人相关数据。这一举措将数据重心从“观看”转向了“交互”。

具体而言,新构建的数据集覆盖了灵巧操作、机器人移动、第一视角交互等高难度场景,总规模达到7万小时的具身数据。这些数据并非简单的视频堆砌,而是包含了丰富的物理交互线索。通过训练,模型学习到了动作与环境变化之间的深层映射关系。例如,当机械手接触物体时,物体发生的形变、滑动或惯性反应,模型不再将其视为噪声,而是作为物理规律的一部分进行建模。这种数据层面的专精,使得LingBot-Video能够生成符合真实世界动力学规律的视频,而非仅仅是对视频风格的模仿。

训练范式:多维强化学习与物理对齐

在训练策略上,LingBot-Video引入了多维强化学习奖励系统,这是其实现物理对齐的关键一步。传统的视频生成模型通常仅优化美学得分、Prompt跟随度(即生成内容与提示词的一致性)以及运动一致性等指标。然而,这些指标无法约束模型的输出是否符合物理定律。

LingBot-Video在奖励函数中显式地加入了“物理合理性”和“任务完成度”两个维度的约束。这意味着,在训练过程中,模型不仅要学会生成好看的画面,还要学会判断生成的动作在物理上是否可行。例如,如果生成的视频中机器人穿过了固体墙壁,或者物体在重力作用下悬浮,系统会给予负向奖励。通过这种细粒度的对齐训练,模型逐渐内化了物理世界的常识和约束。

这种训练范式的转变,使得LingBot-Video生成的视频不仅具有视觉上的逼真度,更具备逻辑上的可解释性。这对于机器人系统的仿真数据生成尤为重要。在现实世界中,收集机器人失败的数据既昂贵又危险,而基于物理一致的生成模型可以创造出大量高质量的合成数据,用于训练和测试机器人的控制算法。

应用场景与未来展望:从生成到预测

LingBot-Video的开源,为具身智能领域提供了一个新的基础底座。其应用场景不再局限于视频生成,而是延伸至机器人动作预测、仿真数据生成、动作条件建模以及世界模型研究等核心方向。

在动作预测方面,模型可以根据机器人的当前状态和意图,生成未来可能的动作序列,帮助机器人提前规避风险。在仿真数据生成方面,它能够创造出各种罕见或极端的交互场景,极大丰富了训练数据集的多样性,解决了长尾场景数据匮乏的问题。此外,作为世界模型研究的一部分,LingBot-Video能够帮助机器人构建对物理环境的内部表征,提升其在未知环境中的泛化能力。

随着MoE架构在视频生成领域的进一步成熟,以及具身数据规模的持续扩大,视频基模将从被动的内容生成工具,转变为主动的物理世界理解引擎。LingBot-Video的出现,标志着这一转变的关键节点。它证明了通过架构优化、数据专精和训练对齐,视频模型完全有能力跨越数字与物理的鸿沟,为机器人的自主智能提供坚实的支持。未来的竞争,将不再是单纯画质的比拼,而是对物理世界理解深度与推理效率的综合较量。