孙鹏加盟星尘智能:强化学习如何驱动Physical AI落地?

2 阅读

近年来,人工智能正经历从“虚拟智能”向“物理智能”(Physical AI)的关键跃迁。当大语言模型在文本世界游刃有余时,如何让AI真正走进厨房、工厂与家庭,完成拧螺丝、端茶倒水等具体任务,成为行业攻坚的核心命题。在此背景下,强化学习(Reinforcement Learning, RL)——这一曾因样本效率低、训练不稳定而被部分边缘化的技术——正重新站上舞台中央。2026年9月,前字节跳动强化学习专家、腾讯Robotics X智能体中心前负责人孙鹏博士加盟星尘智能,标志着强化学习在具身智能商业化落地中的战略价值获得实质性认可。

孙鹏的履历横跨学术与工业界,其技术主线始终围绕“智能体如何通过环境交互持续优化策略”展开。从清华博士起步,经康奈尔与罗格斯大学博士后训练,他早期在腾讯AI Lab主导轮式机器人端到端目标跟随项目,利用深度强化学习实现无需显式规划的自主导航。更引人注目的是其团队开发的《星际争霸》AI TStarBotX,在多智能体强化学习(MARL)框架下处理数百单位协同作战,展现了复杂动态环境中策略泛化的能力。这类研究虽属虚拟场景,却为后续真实机器人控制积累了关键算法经验。

转入字节跳动后,孙鹏的技术视野从单一算法扩展至系统工程层面。他主导构建的ByteRL平台,支撑了包括《炉石传说》AI在内的多个高难度游戏智能体训练。该系统不仅实现了百万级CPU/GPU资源的高效调度,更通过课程学习(Curriculum Learning)与对手池机制(Opponent Pooling),显著提升策略收敛速度与鲁棒性。IEEE CoG 2023竞赛冠军的取得,验证了其在大规模分布式RL系统上的工程实力。值得注意的是,这些游戏环境虽为虚拟,但其状态空间复杂度、稀疏奖励特性与真实物理任务高度相似,使得技术迁移具备可行性。

随着大模型浪潮兴起,孙鹏进一步将RL能力嫁接至LLM后训练环节。在ByteResearch期间,他参与提出的ReFT(Reinforced Fine-Tuning)方法,通过引入任务导向的奖励信号对模型进行微调,显著提升数学推理与代码生成质量。同时,其主导的DeltaProver项目构建了基于形式化验证的推理智能体,在定理证明任务中展现出超越纯监督微调的泛化能力。这些探索揭示了一个重要趋势:强化学习不仅是行为策略的优化工具,更是连接大模型“认知能力”与“行动能力”的桥梁。

星尘智能自成立起便坚持“Design for AI”理念,拒绝将机器人本体、操作系统与AI模型割裂设计。其技术栈包含三大核心:绳驱驱动的柔性机器人本体、具身操作系统(Embodied OS),以及Lumo系列基座模型。Lumo-1首次引入“因果动作理解”,使机器人能解释“为何执行某动作”;Lumo-2则更进一步,构建隐式世界动力学模型(Latent World Dynamics),在潜在空间预测环境未来状态后再生成动作,大幅降低试错成本。前端Agent Philia则负责长期记忆管理、多机协同与自然语言交互,形成从感知到决策的完整链路。

然而,即便拥有强大基座模型,机器人在真实场景仍面临“演示可行、部署失效”的困境。实验室中完美复现的动作,在家庭复杂光照、地面摩擦变化或物体形变下可能完全失灵。此时,强化学习的价值凸显——它提供了一套从真实执行结果中持续学习的机制。孙鹏的加入,正是为了补全这一“训练之后”的关键闭环。具体而言,其团队将聚焦三个方向:一是构建面向真实机器人的高效RL采样框架,解决物理交互数据获取成本高的问题;二是开发基于大模型先验知识的奖励函数设计方法,避免传统RL中人工设计奖励的局限性;三是探索多模态反馈(如视觉、力觉、语音)融合的策略更新机制,使机器人能综合多种信号优化行为。

一个典型应用场景是家庭服务机器人学习“端水不洒”。传统模仿学习仅能复制人类示范动作,但无法应对杯子重量变化、桌面倾斜等扰动。而通过强化学习,机器人可在数千次真实尝试中,逐步调整手腕角度、移动速度与重心偏移策略,最终形成鲁棒的行为模式。孙鹏团队计划将Lumo模型的环境预测能力与RL策略搜索结合:先由Lumo-2在隐空间模拟不同动作后果,筛选高潜力策略再投入真实执行,从而将物理试错次数减少一个数量级。

更深远的影响在于推动Physical AI的“进化范式”转变。过去机器人开发依赖工程师预设规则库,新任务需重新编程;而孙鹏倡导的RL+大模型架构,使机器人具备“任务内学习”(In-task Learning)能力——即在单次任务执行中根据即时反馈调整策略。例如,当机器人首次遇到新型门把手时,可结合Lumo的视觉理解生成初始操作假设,再通过几次尝试中的力觉反馈快速修正抓握力度与旋转方向。这种能力对家庭、养老等非结构化场景至关重要。

值得注意的是,星尘智能的绳驱本体设计为此提供了独特优势。相比刚性关节机器人,绳驱系统具有天然柔顺性与高功率密度,更适合安全的人机交互,同时也为RL训练提供了更丰富的力控信号。孙鹏团队正探索将肌腱张力数据作为策略网络的输入特征,使机器人能像人类一样通过“手感”判断操作是否到位。这种本体-算法协同设计,正是Physical AI区别于传统机器人学的核心差异。

行业观察显示,全球头部玩家已纷纷加码机器人强化学习。Google DeepMind的RT-2模型结合视觉语言模型与RL策略,实现跨任务泛化;NVIDIA的VIMA框架利用扩散模型生成动作序列,再通过RL微调提升成功率。但多数方案仍停留在仿真到现实的迁移(Sim2Real)阶段,缺乏真实环境中的持续学习闭环。星尘智能凭借全栈自研能力,有望率先实现“真实数据→策略更新→性能提升”的正向循环。

孙鹏本人对此抱有清晰认知:“强化学习不是万能药,但在Physical AI的拼图中,它是让其他模块‘活起来’的催化剂。”他强调,未来工作将避免陷入纯算法竞赛,而是紧密围绕产品需求——例如家庭清洁机器人的污渍识别与路径规划协同优化,或物流机器人的动态避障与能耗平衡。这种以场景驱动的技术路线,或将加速具身智能从Demo走向规模化商用。

可以预见,在孙鹏团队推动下,星尘智能的强化学习体系将呈现三大特征:一是与大模型深度耦合,利用LLM的世界知识指导探索方向;二是轻量化部署,通过策略蒸馏(Policy Distillation)将大型RL策略压缩至边缘设备;三是开放协作,允许用户通过自然语言反馈参与奖励函数定义,实现“人在回路”的个性化学习。这些创新不仅关乎技术指标,更将重塑人与机器的关系——机器人不再是固定功能的工具,而是能随使用时间不断进化的伙伴。

从腾讯的星际战场到字节的游戏竞技场,再到星尘的真实物理世界,孙鹏十余年的技术轨迹恰是AI从虚拟走向实体的缩影。当行业热议“机器人何时爆发”时,其加盟传递出明确信号:真正的突破不在于单点技术炫技,而在于构建涵盖本体、系统、模型与学习机制的完整生态。强化学习作为其中的“进化引擎”,正推动Physical AI迈过从“能做”到“可靠做好”的关键门槛。