强化学习回归具身智能:孙鹏加盟星尘如何重塑机器人后训练闭环?
近年来,人工智能的发展路径呈现出一条清晰的演进轨迹:从纯数字世界的语言与图像理解,逐步延伸至物理空间中的行动与交互。这一转变的核心载体,正是具身智能(Embodied Intelligence)——让AI不仅“知道”,更要“做到”。而在这场从虚拟走向现实的跨越中,强化学习(Reinforcement Learning, RL)正重新成为关键技术支点。
2024年9月2日,一个标志性事件印证了这一趋势:前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责人孙鹏博士正式加入星尘智能(Astribot),将全面负责机器人强化学习方向的技术研发与应用探索。这一人事变动不仅体现了顶尖人才对具身智能赛道的信心,更揭示了一个深层逻辑:当机器人基础模型已初步解决“会不会”的问题后,真正的挑战在于“能不能稳定、可靠、持续地做好”。
强化学习为何重回舞台中央?
过去两年,以VLA(Vision-Language-Action)为代表的机器人基础模型取得了显著进展。通过大规模数据预训练,机器人能够理解自然语言指令、感知环境状态并生成初步动作序列。然而,这些模型在仿真或受控环境中表现优异,一旦进入复杂、动态、充满不确定性的现实世界,其性能往往大幅下降。原因在于,基础模型本质上是“开环”的——它基于历史数据预测动作,但缺乏对执行结果的实时反馈与修正机制。
这正是强化学习的核心价值所在。RL通过“试错—反馈—优化”的闭环机制,使智能体能够在与环境的真实交互中不断调整策略,提升任务成功率与鲁棒性。尤其在机器人领域,执行误差、传感器噪声、物体形变、光照变化等现实因素使得“一次成功”难以复制,唯有通过持续学习才能实现稳定表现。
因此,随着机器人从Demo走向商业化部署,行业关注点正从“能力覆盖广度”转向“执行质量深度”。强化学习不再是锦上添花的可选项,而是确保机器人在真实世界中可靠运行的必选项。
孙鹏的技术积淀:从机器人控制到大模型对齐
孙鹏博士的职业轨迹,恰是强化学习十年演进的缩影。他毕业于清华大学,随后在康奈尔大学与罗格斯大学完成博士后研究,十余年来始终围绕“智能体如何通过交互学习”这一核心命题深耕不辍。
在腾讯AI Lab及Robotics X期间,他作为智能体中心负责人,率先将深度强化学习应用于轮式机器人控制,实现了端到端的主动目标跟随。更引人注目的是,他主导开发的《星际争霸》AI智能体TStarBots系列,在多智能体强化学习(MARL)框架下处理复杂博弈、资源调度与协同决策,展现了RL在高维状态空间中的强大潜力。
转战字节跳动后,孙鹏的技术视野从算法层拓展至系统工程层。他主导构建了大规模强化学习基础设施ByteRL,支撑多款游戏AI的高效训练。其团队在IEEE CoG 2023策略卡牌AI竞赛中夺冠,所研发的《炉石传说》AI不仅能击败职业选手,更展示了在不完全信息博弈中策略泛化的能力。
随着大语言模型(LLM)兴起,孙鹏敏锐地将RL经验迁移至模型后训练领域。在字节AI Lab/ByteResearch,他作为项目负责人提出强化微调方法ReFT(Reinforced Fine-Tuning),并参与开发数学推理智能体DeltaProver。在Seed团队,他深度参与RLHF(基于人类反馈的强化学习)流程,在模型对齐、推理增强与Agent架构设计方面积累了前沿经验。
这条从机器人RL→大规模RL系统→大模型后训练的技术路径,看似跨度极大,实则内核一致:如何让智能体在与环境(无论是物理世界还是人类偏好)的交互中,持续优化其行为策略。如今,这一能力正被重新锚定于具身智能的物理落地场景。
星尘智能的全栈布局与强化学习的闭环定位
星尘智能自成立以来,始终坚持“Design for AI”的理念,拒绝将机器人本体、操作系统与AI模型割裂设计。其技术体系可概括为三大支柱:绳驱机器人本体、具身操作系统(Embodied OS)、以及AI模型栈。
在AI模型层面,星尘已推出Lumo系列基座模型。Lumo-1聚焦动作语义理解,回答“为什么做这个动作”;Lumo-2则进一步引入隐式世界动力学(Latent World Dynamics),在潜在空间中预测未来状态后再生成动作,显著提升了长时程任务的连贯性与合理性。前端Agent Philia则负责长期记忆、任务规划、多机协同与自然交互,构成机器人的“认知中枢”。
然而,即便拥有强大的基座模型与Agent架构,若缺乏与真实世界的反馈闭环,机器人仍难以应对现实复杂性。这正是孙鹏加入的战略意义所在——补全“训练之后”的关键一环。
强化学习在此扮演的角色,是连接模型预测与物理执行的桥梁。具体而言,它承担三大功能:
- 执行校准:通过在线微调,修正模型在真实环境中因域偏移(domain shift)导致的动作偏差;
- 策略优化:基于任务成功率、能耗、安全性等多维奖励信号,迭代提升行为策略;
- 持续进化:构建数据飞轮,将每次真实交互转化为训练数据,驱动模型长期演进。
孙鹏的加入,将加速星尘构建“感知—决策—执行—反馈—学习”的完整闭环。他不仅带来算法层面的创新(如结合大模型先验知识的RL算法),更具备构建大规模分布式RL训练系统的能力,这对于处理海量机器人交互数据至关重要。
未来方向:大模型时代的机器人后训练新范式
值得注意的是,孙鹏并非简单地将传统机器人RL方法移植到星尘平台,而是致力于探索大模型时代下的机器人后训练新范式。
传统RL依赖大量试错,成本高昂且效率低下。而大模型提供了强大的先验知识与泛化能力,可显著减少探索空间。例如,Lumo模型已能生成合理的初始动作序列,RL则在此基础上进行精细化调整,而非从零开始学习。这种“预训练+强化微调”的混合范式,有望大幅提升学习效率。
此外,RLHF的经验也可迁移至物理世界。在LLM训练中,人类偏好用于指导模型输出;在机器人场景中,用户满意度、任务完成质量、操作流畅度等均可转化为奖励信号,实现“以人为中心”的策略优化。
孙鹏本人对此有清晰认知:“我很希望把这些积累真正带回物理世界……让机器人不只是‘学会一个任务’,而是能够在一次次真实执行和反馈中,把任务越做越好。” 这一愿景,正是具身智能走向实用化的关键一步。
行业启示:强化学习不是回归,而是升维
孙鹏加盟星尘智能,不应被简单解读为“强化学习重回热点”,而应视为该技术在新阶段的战略升维。过去,RL常被视为小众、低效、难以落地的学术工具;如今,在大模型提供强大先验、机器人硬件日趋成熟的背景下,RL正转变为连接数字智能与物理行动的核心使能技术。
对行业而言,这一趋势释放出明确信号:未来的机器人竞争,不仅是模型参数量或数据规模的比拼,更是闭环学习能力的较量。谁能构建高效、安全、可扩展的强化学习部署体系,谁就能在真实场景中建立持久优势。
星尘智能凭借其全栈整合能力,已站在这一浪潮的前沿。而孙鹏的加入,无疑为其注入了关键的“学习引擎”。随着技术闭环的逐步完善,我们或将见证一类新型机器人:它们不仅聪明,更能从每一次跌倒与成功中汲取经验,真正实现“越用越好用”的智能进化。
这或许正是具身智能从概念走向日常的真正起点。