具身智能进化新纪元:RLinf v0.3如何打通从仿真到真机的最后一里路?

0 阅读

具身智能的“进化底座”:打破从仿真到现实的鸿沟

具身智能(Embodied AI)行业正站在一个历史性的转折点上。过去,我们更多依赖静态数据的模仿学习,但现实世界的复杂性要求机器人必须具备在线学习、持续进化的能力。这种从“数据驱动”向“经验驱动”的范式转变,并非简单的技术叠加,而是一场对基础设施重构的系统性工程。

然而,现实中的强化学习(RL)流程极其复杂。系统组件的异构性、资源形态的多样性,以及真实世界在线学习难以规模化的痛点,如同几座大山横亘在具身智能大规模落地之前。参数难调、结果难复现、训练与部署脱节,这些问题长期困扰着行业开发者。

在此背景下,由无问芯穹联合清华大学等机构共同研发的 RLinf v0.3 正式亮相。这不仅仅是一次版本迭代,而是全球首个面向具身智能持续进化的大规模强化学习基础设施的里程碑式升级。RLinf v0.3 的核心价值在于,它构建了一个全新的“进化底座”,首次完整打通了从数据采集、数据管理、监督微调(SFT)、强化学习(RL)、模型评测到真机部署的全链路闭环。这意味着,开发者不再需要拼装 disparate 的工具链,而是可以在一个统一的平台中,实现从仿真训练到真实机器人在线学习,再到持续迭代优化的完整生命周期管理。

模型生态扩张:从单一策略到多元世界模型

在具身智能的感知与决策核心——模型层面,RLinf v0.3 展现了惊人的兼容性与扩展性。此次升级新增了对 6 款主流具身模型的深度支持,涵盖了世界模型、视觉语言动作(VLA)模型以及系统级加速优化方案。

这一扩展并非简单的罗列,而是针对不同类型任务的最优匹配。例如,新增的 Dexbotic DM0 模型支持在 LIBERO 环境下进行 PPO 在线 RL 微调,为精细操作任务提供了新的策略选择。更具突破性的是对 DreamZero 模型的支持。作为基于 WAN2.1/2.2 视频生成世界模型微调的 VLA 策略,DreamZero 集成进 SFT 工作流后,通过 FSDP2 和 CUDA Graph 等系统级加速技术,实现了近乎 4 倍的吞吐提升。这种性能飞跃,直接解决了视频生成模型在实时控制中常见的延迟瓶颈。

此外,RLinf v0.3 还纳入了 GR00T-N1.6/N1.7、ABot-M0、StarVLA 以及 LingBot-VLA 等前沿模型。特别是 StarVLA 对 LIBERO 环境的 GRPO 支持,以及 LingBot-VLA 在 RoboTwin 环境中的 SFT/RL 双重支持,极大地丰富了算法选择的多样性。这种开放包容的模型生态,使得开发者能够根据具体硬件约束和任务需求,灵活选择最合适的策略模型,从而避免了“一刀切”带来的性能损耗。

算法体系重构:覆盖模仿学习到真机进化的全谱系

算法是强化学习的灵魂。RLinf v0.3 在算法体系上进行了全方位的重构与扩充,实现了从模仿学习到真机强化学习,再到人在环学习的全谱系覆盖,并在多项基准测试中达到了 State-of-the-Art (SOTA) 的表现。

在真机强化学习方向,RLinf v0.3 引入了多种先进的算法架构。DSRL(Diffusion Steering via Reinforcement Learning)被扩展至 Pi0.5 模型,增强了扩散策略在真实物理环境中的鲁棒性。RECAP 训练流水线的支持,基于离线优势估计策略优化,为数据高效利用提供了新路径。同时,SAC-Flow 算法被扩展到 DOS-W1 等真机场景,进一步提升了连续控制任务的性能。

在仿真环境方面,Async PPO 在 v0.2 基础上扩展了对 MLP 等新策略的支持,并新增了 async DSRL 配置,显著提升了大规模并行训练的效率。D4RL 离线 IQL 训练支持的加入,使得 Antmaze、Kitchen-Adroit 和 MuJoCo 等复杂场景的离线学习成为可能,且基于 FSDPStrategy 的分布式方案确保了训练稳定性。

特别值得一提的是“人在环学习”方向的突破。DAgger 在线模仿学习算法的支持,覆盖了 LIBERO、ManiSkill、RoboTwin 及真机 PnP 多场景。HG-DAgger(Human-Gated DAgger)真机在线训练支持的加入,则允许人类专家在机器人学习过程中进行实时干预和指导,这种混合智能范式对于解决长尾分布下的边缘案例至关重要,极大地加速了机器人的收敛过程。

真机部署闭环:打通从数据到执行的最后一环

具身智能的最终落脚点在于真实世界。RLinf v0.3 最大的亮点之一,便是彻底打通了从数据采集到真机部署的全链路闭环。在此之前,数据采集、训练、部署往往分散在不同的工具链中,导致数据格式不兼容、策略迁移困难等问题频发。

新版 RLinf v0.3 在数据采集端引入了空间鼠标(Spacemouse)、VR 遥操作以及 GELLO 遥操作等多种方式,丰富了人类示教数据的获取途径。同时,新增 LeRobot 格式数据采集支持,实现了与 HuggingFace LeRobot 生态的无缝互通,降低了数据共享和复用的门槛。

在训练与部署链路中,RLinf v0.3 新增了 Pi0 真机 SFT 部署支持,真正实现了“采集即训练,训练即部署”的高效流转。此外,真机 reward model 数据采集功能的加入,使得开发者能够采集带有标注奖励的训练数据,为基于奖励模型的强化学习提供了坚实的基础。

硬件兼容性方面,RLinf v0.3 表现同样出色。新增双臂 Franka 平台、GimArm 真机平台以及 DOS-W1 真机平台的支持,覆盖了从双臂协作到单臂操作的多种形态。末端执行器方面,Franka DexHand 灵巧手、Franka Robotiq 夹爪以及多种相机后端(ZED / LUMOS V4L2)的支持,使得系统能够适配复杂的精细操作任务。这种硬件层面的广泛适配,标志着 RLinf 正在构建一个标准化的具身智能部署接口。

仿真与系统基座:为大规模训练提供坚实支撑

仿真环境是强化学习训练的温床,而系统基座则是支撑大规模训练的地基。RLinf v0.3 在这两个维度上也进行了显著增强。

在仿真方面,新增的 Genesis、Polaris 和 RoboVerse 仿真器支持,极大地扩展了场景覆盖范围。Behavior 环境的完善、Libero+ / LiberoPro 变体环境的支持,以及 IsaacLab 上 π0.5 PPO finetuning 的加入,为开发者提供了丰富的测试基准。特别是 Embodichain(CartPole)环境和 RoboCasa close-drawer 等 RL 示例的支持,降低了入门难度,加速了算法验证过程。

系统基座的升级则是为了应对大规模训练带来的算力与效率挑战。RLinf v0.3 新增了 Reward Model 组件、Value Model 组件以及 SGLang 推理服务化组件,构建了更完善的训练基础设施。解耦环境执行组件的引入,解除了 Env Worker 与 Rollout Worker 的一对一绑定,显著提升了 GPU 利用率。

性能优化方面,torch.compile 加速、rollout 与训练重叠、权重同步升级(broadcast/增量同步/分桶同步/仅同步可训练参数)以及 FSDP 全 offload 支持等技术的加入,有效解决了显存泄漏等关键问题,提升了训练吞吐量。更值得关注的是,RLinf v0.3 全面支持昇腾 Ascend、AMD ROCm、Musa 等国产及异构 AI 计算平台,实现了跨硬件的统一训练能力,这在全球范围内具有极高的战略意义。

展望:智能体 AI 的通用训练引擎

RLinf v0.3 的野心不止于传统机器人控制。通过新增 AgentLightning 多轮单智能体 RL 训练、Megatron-Bridge actor 后端支持,以及 SearchR1 的多轮接口重构,RLinf 正在拓展至智能体 AI(Agentic AI)领域。这表明,RLinf 正试图成为具身智能与大模型智能体通用的强化学习训练引擎。

自开源以来,RLinf 已获得超过 4100+ Stars 和 600+ Forks,成为该领域最受关注的基础设施项目之一。其被 Isaac Lab 官方收录为首个面向具身大模型的训练引擎,以及与 NVIDIA 在医疗器械组装任务上的合作登上 GTC 2026,均印证了其在国际技术前沿的地位。

未来,RLinf 将继续坚持开源路线,通过完善的开发 Roadmap 和社区互动,携手全球研究者共同推动具身智能技术的发展。在这个从“数据驱动”迈向“经验驱动”的关键拐点,RLinf v0.3 不仅提供了一套工具,更提供了一种标准化的进化范式,为具身智能在真实世界中的规模化落地奠定了坚实基础。