异步推理时代下的在线强化学习:SmoothRL如何解决机器人动作对齐难题?

1 阅读

近年来,随着视觉-语言-动作(VLA)模型和World-Action Model等大模型在机器人领域的快速渗透,一个现实矛盾日益凸显:模型推理速度跟不上物理世界的实时性要求。大型策略模型往往需要数百毫秒才能生成一段包含多帧动作的序列(即action chunk),而真实机器人——尤其是执行高速动态任务的机械臂——无法在每次动作边界处“暂停等待”。这种时间错配迫使系统采用异步推理架构:机器人持续执行当前动作,同时后台模型并行计算下一动作序列。这种模式虽保障了动作连续性,却给在线强化学习(Online RL)带来了根本性挑战。

异步执行下的强化学习困境

传统在线RL范式建立在一个隐含假设之上:模型输出的动作序列会被完整执行,环境反馈直接对应于该序列的整体效果。然而在异步部署中,这一对应关系被彻底打破。当新一轮action chunk生成时,机器人可能已执行了上一轮的部分动作;而新生成的动作序列本身也可能在完全执行前就被后续推理结果覆盖。由此,一个action chunk内部的动作呈现出三种截然不同的命运:

  • 已提交区域(Committed Region):这些动作在上一轮推理中已被“锁定”,无论后续如何变化都必须执行完毕;
  • 执行区域(Execution Region):当前轮次中新生成且实际被执行的动作片段;
  • 丢弃区域(Discarded Region):虽由模型生成,但因后续推理提前到来而从未被执行的动作。

若仍沿用传统RL方法,将整个action chunk视为一个整体进行策略更新,就会导致严重的信用分配错误。例如,在一次成功的投掷任务中,丢弃区域的动作可能因时间巧合被错误地赋予正向奖励;反之,在失败案例中,真正执行的动作可能因与未执行部分捆绑而承担不合理的惩罚。这种“对错账”现象会严重扭曲策略梯度,阻碍模型收敛到真实有效的行为模式。

SmoothRL的核心机制:只学真正执行的动作

针对上述问题,星尘智能提出的SmoothRL框架确立了两个关键原则:精准梯度路由部署一致性训练

首先,在策略更新阶段,SmoothRL严格限制反向传播仅通过执行区域。具体而言,其采用轻量级TD3-style的actor-critic架构,在冻结的基础策略(如微调后的π0.5)之上预测残差修正(residual correction)。价值网络的梯度计算仅基于实际被执行的动作帧,确保优化目标与物理世界的真实因果链保持一致。这种设计避免了对未执行动作的无效学习,大幅提升了样本效率。

其次,SmoothRL在训练rollout阶段就模拟真实的异步执行节奏。系统以固定频率(如5Hz)触发模型推理,同时机器人以更高频率(如30Hz)执行动作。replay buffer中存储的轨迹天然包含了committed、execution和discarded区域的时间结构。这种“Reinforce in Deployment”(在部署中强化学习)的理念,使得训练过程直接面对真实系统的时间动态,消除了同步仿真与异步部署之间的域偏移。

在技术实现上,SmoothRL沿用了RLT(Reinforcement Learning with Trajectory)的基本骨架,但对其时间对齐机制进行了重构。以S1机械臂为例,基础策略每次预测32帧动作(约1秒),在200ms的推理延迟预算下,前12帧被划分为committed与execution区域(各6帧),剩余20帧则属于潜在的discarded区域。这种划分并非静态,而是根据实际推理完成时刻动态调整,确保执行区域始终对应最新有效的动作指令。

真实任务验证:从高速投掷到毫米级操作

SmoothRL的有效性在三项极具挑战性的真机任务中得到充分验证,覆盖了高动态与高精度两大典型场景。

动态投掷任务要求机械臂从随机位置抓取物体并投入不同距离的目标箱。该任务的关键在于手臂需在连续摆动中积累动能,并在精确时刻释放。任何在action chunk边界的停顿都会导致速度骤降,使后续摆动无法恢复所需释放能量。实验显示,基础策略的成功率仅为39%,而经过SmoothRL在线微调后,成功率跃升至94%。更值得注意的是,优化后的动作不仅更准确,还显著提升了平滑性:末端执行器的加速度均方根下降52%,急动度(Jerk)降低47%,表明策略学会了避免突兀的加速/减速,实现更流畅的动力学控制。

给笔戴帽任务则考验双臂协同的毫米级精度。笔与笔帽的对齐容差仅约5mm,基础策略虽能接近目标位姿,但对笔帽位置微小变化的适应性不足,初始成功率仅8%。SmoothRL通过在线学习有效修正了系统性偏差,最终将成功率提升至83%。失败案例的分析显示,误差已从大范围偏移收敛为成功位置附近的小幅错位,证明RL专注于“精修”而非“重学”。

快递开箱任务最具挑战性:需用1mm宽刀片插入2–3mm宽的箱盖接缝并切开胶带。基础策略存在稳定的左偏倾向,初始成功率30%。SmoothRL的学习曲线呈现非单调特性——在150个rollout episodes时成功率一度降至20%,随后回升并最终达到90%。这一现象揭示了真实在线探索的复杂性:策略可能在修正旧偏差时引入新误差,需通过持续交互逐步收敛。最终,失败样本的刀片位置偏差缩小至1–2mm,接近物理操作的极限精度。

从“会不会”到“准不准”:在线学习的新定位

SmoothRL的实践标志着机器人学习范式的演进:预训练大模型解决了“会不会做”的问题,而在线强化学习则聚焦于“做得够不够准、稳、可靠”。这种分工具有深刻的工程意义。预训练策略通过海量数据获得泛化能力,覆盖广泛的任务空间;而在线RL则作为轻量级的“微调引擎”,利用真实执行反馈快速适配特定场景的细微差异。

值得注意的是,当前SmoothRL仍依赖稀疏的成功/失败奖励,并允许操作员在必要时介入。介入动作被直接纳入原始动作空间用于训练,形成人机协同的在线学习闭环。这虽非完全自主进化,却为真实部署提供了高效可行的后训练机制。其局限性也清晰可见:若基础策略与目标行为差距过大,局部残差修正难以弥补根本性缺陷;此外,系统要求每次chunk-level推理必须在预设延迟预算内完成,对计算资源提出一定要求。

动作作为“第一公民模态”的长期愿景

SmoothRL的背后,是星尘智能对机器人智能本质的深层思考:动作不应是视觉或语言模型的附属输出,而应成为具身智能的核心模态。从Lumo-1的显式动作推理,到Lumo-2对动作引发世界状态变化的预测,再到SmoothRL对动作执行真实性的严格对齐,这一脉络始终强调“为何这样动”的因果建模。在此框架下,星尘构建了从前端Agent(负责任务理解与能力调用)、中间基座模型(提供通用操作能力)到RL后训练(实现真实世界精修)的完整技术栈。

配合“AI模型-具身OS-绳驱本体”的全栈系统迭代,SmoothRL不仅是一项算法创新,更是推动Physical AI规模化落地的关键拼图。它回答了一个日益紧迫的问题:当大模型赋予机器人初步能力后,如何让这些能力在真实世界的千变万化中持续进化?答案或许就在于——让学习过程本身,与机器人的每一次真实动作同步发生。