具身智能进化:RLinf v0.3如何重构强化学习落地闭环

0 阅读

具身智能行业正站在一个决定性的历史拐点:从单纯依赖静态数据的“数据驱动”,彻底转向能够在真实世界中持续交互、自我修正的“经验驱动”。在这一转型过程中,机器人不再仅仅是预设程序的执行者,而是需要具备在线进化能力的智能体。然而,现实世界充满了非结构化挑战,强化学习流程的复杂性、系统组件的异构性、资源形态的多样性,以及真实世界在线学习的规模化难题,成为了阻碍具身智能大规模落地的核心瓶颈。

在此背景下,由无问芯穹联合清华大学等顶尖科研机构共同研发的全球首个面向具身智能持续进化的大规模强化学习基础设施项目——RLinf,正式宣布升级至v0.3版本。这不仅仅是一次版本迭代,更标志着从单一训练工具向一站式“进化底座”的范式转变。v0.3版本首次完整打通了从数据采集、数据管理、监督微调(SFT)、强化学习(RL)、模型评测到真机部署的全链路闭环,实现了从仿真训练到真实机器人在线学习,再到持续迭代优化的统一开发架构。

模型生态的全面扩容与异构兼容

在具身智能领域,模型的种类与适配能力直接决定了系统的上限。RLinf v0.3显著扩展了模型生态,新增了6款主流具身模型的支持,涵盖了世界模型、视觉-语言-动作(VLA)模型以及系统级加速方案。

其中,Dexbotic DM0模型的加入,使得在LIBERO环境中通过PPO进行在线强化学习微调成为可能,为精细操作任务提供了新的策略选择。DreamZero模型的集成则代表了另一种技术路径:基于WAN2.1/2.2视频生成世界模型微调的VLA策略,不仅集成了监督微调工作流,更通过FSDP2和CUDA Graph等系统级加速技术,实现了近4倍的吞吐提升。这一优化对于处理高分辨率视觉输入和复杂时间序列动作至关重要。

此外,GR00T-N1.6/N1.7、ABot-M0、StarVLA(支持GRPO在LIBERO上的应用)以及LingBot-VLA(支持RoboTwin环境下的SFT/RL)的加入,极大地丰富了策略选择的多样性。这种多模型兼容能力,使得开发者可以根据具体任务场景(如复杂抓取、移动导航或长程规划)灵活选择最适宜的基座模型,避免了因模型锁定带来的开发限制。

算法体系的精细化与场景全覆盖

算法是强化学习的灵魂,而RLinf v0.3在算法体系上的升级,体现出了对“算法-场景”匹配度的极致追求。新版在真机RL、仿真RL和人在环学习三个维度进行了深度优化,并在多项指标上达到了SOTA(State of the Art)水平。

在真机强化学习方面,DSRL(Diffusion Steering via Reinforcement Learning)被扩展至Pi0.5模型,利用扩散模型的优势提升策略的鲁棒性。RECAP(基于离线优势估计的策略优化)训练流水线的支持,解决了真机数据稀缺问题,通过离线数据预训练引导在线学习。SAC-Flow算法的引入,则进一步扩展到DOS-W1等真机场景,增强了连续动作空间下的控制精度。

仿真环境作为低成本试错的温床,其算法支持同样关键。Async PPO在v0.2基础上扩展了对MLP等新策略的支持,并新增async DSRL配置,提升了异步训练的效率。D4RL离线IQL训练支持覆盖了Antmaze、Kitchen-Adroit和MuJoCo等经典基准,基于FSDP策略实现了大规模离线数据的高效利用。

更值得关注的是人在环学习(Human-in-the-Loop)的深化。DAgger在线模仿学习算法在LIBERO、ManiSkill、RoboTwin及真机PnP多场景中落地,结合HG-DAgger(Human-Gated DAgger)真机在线训练支持,使得人类专家的直觉经验能够更高效地转化为机器人的底层策略。这种“人机协同”的学习范式,正在成为解决具身智能“长尾问题”的关键手段。

真机部署:打通从采集到执行的全链路

具身智能的最终价值体现在物理世界。RLinf v0.3最显著的突破之一,是全面打通了从数据采集到真机部署的闭环链路。这一闭环不仅包括软件层面的策略部署,更涵盖了硬件层面的多样性支持。

在数据采集端,系统新增了对空间鼠标(Spacemouse)、VR遥操作以及GELLO遥操作三种主流方式的支持。这种多元化的采集接口,允许研究者使用不同精度的硬件设备构建数据集,极大降低了数据采集的门槛。同时,新增LeRobot格式数据采集支持,使得RLinf能够与Hugging Face LeRobot生态无缝互通,促进了数据标准的统一。

在训练与部署链路中,Pi0真机SFT部署支持的加入,意味着从数据采集到监督微调再到真机部署的链路已被彻底打通。此外,真机Reward Model数据采集支持(采集带标注Reward训练数据)的引入,为强化学习提供了更高质量的反馈信号。

硬件兼容性方面,RLinf v0.3新增了对双臂Franka、GimArm、DOS-W1三款真机平台的支持,并兼容Franka DexHand灵巧手、Franka Robotiq夹爪以及ZED/LUMOS V4L2相机等末端执行器。这种对关节空间、TCP/rot6d控制、多模态传感器及不同末端执行器的广泛支持,使得RLinf能够适应从实验室环境到工业现场的各种复杂部署需求。

仿真环境:构建高保真的数字孪生世界

仿真环境是具身智能算法研发不可或缺的训练场。RLinf v0.3通过新增5种仿真器,显著提升了仿真强化学习的场景覆盖率和逼真度。

Genesis、Polaris和RoboVerse等新型仿真器的加入,为研究者提供了更多基于物理引擎和渲染效果的选项。其中,Genesis以其高速物理仿真能力,适合大规模并行训练;Polaris和RoboVerse则在特定领域任务(如物流、服务机器人)中表现出优势。

对Behavior环境的完善,包括新增v3.7.1/v3.7.2版本补丁、π0.5 PPO配置以及object/pose randomization(物体/位姿随机化),极大地增强了仿真环境的泛化能力。通过随机化物理参数和视觉干扰,模型能够在仿真中学习更鲁棒的策略,从而更好地迁移到真实世界。

此外,Libero+/LiberoPro变体环境、Embodichain(CartPole)环境、IsaacLab上π0.5 PPO finetuning支持,以及RoboCasa close-drawer等RL示例的加入,构建了一个覆盖基础控制、复杂操作到家居服务等多元场景的仿真生态。这种丰富的仿真资源,为算法的快速原型验证提供了坚实基础。

系统基座:异构计算与性能优化的双重突破

任何强大的上层应用都离不开稳固的系统基座。RLinf v0.3在系统层面进行了多项底层重构,旨在解决大规模训练中的性能瓶颈和硬件兼容性问题。

新增的Reward Model组件,支持embodied reward worker结合ResNet/VLM奖励模型,为强化学习提供了细粒度的反馈机制。Value Model作为通用基础设施,支撑了如Pi0.6 RECAP等复杂流水线。SGLang推理服务化组件采用HTTP server + router模式,可作为Reward服务或Rollout推理后端,实现了推理服务的解耦与高效调度。

在性能优化方面,解耦环境执行组件打破了Env Worker与Rollout Worker的一对一绑定,显著提升了GPU利用率。torch.compile加速、Rollout与训练Overlap、权重同步升级(支持broadcast/增量同步/分桶同步/仅同步可训练参数)以及FSDP全offload支持,共同构成了高性能训练的技术栈。这些优化不仅修复了显存泄漏等关键Bug,更将系统吞吐量推向了新高。

尤为关键的是,RLinf v0.3全面支持昇腾Ascend(CANN/torch-npu)、AMD ROCm、Musa等国产及异构AI计算平台。在算力自主可控成为行业共识的当下,这种跨硬件的统一训练能力,意味着具身智能的开发不再受限于特定厂商的生态,真正实现了“一次开发,多端部署”。

迈向Agentic AI:智能体进化的新引擎

RLinf v0.3不仅服务于传统具身智能,更为Agentic AI(智能体人工智能)提供了强大的训练和评测基础。新增的AgentLightning多轮单智能体RL训练与Calc-X评测支持,使得智能体能够在复杂交互环境中进行长期规划与决策。

Megatron-Bridge actor后端的支持,基于Megatron-mbridge模型实现了高效的RL训练与SFT,为大模型与强化学习的深度融合提供了可能。SearchR1被重构为多轮接口,并内置WideSeek judge的SGLang支持,进一步提升了智能体在搜索与推理任务中的表现。

自开源以来,RLinf以4100+ Stars、600+ Forks和100+ Contributors的规模,迅速成为全球具身智能与大模型强化学习领域最受关注的基础设施项目之一。其被Isaac Lab官方收录为首个面向具身大模型的训练引擎,以及团队与NVIDIA合作任务登上GTC 2026,均印证了其国际技术引领地位。

RLinf v0.3的发布,不仅解决了一系列技术痛点,更构建了一个开放、兼容、高效的具身智能进化生态。从模型算法的真机落地,到异构计算的广泛兼容,再到Agentic AI的前沿探索,RLinf正以坚实的“进化底座”,推动具身智能从实验室走向千行百业,开启智能机器人持续进化的新篇章。未来,随着社区Roadmap的推进和更多开发者的加入,这一基础设施必将释放出更大的行业价值。