清华等开源RPent框架:让大模型在真实机器人上持续完成复杂任务
RPent让机器人从“会动”变成“会做事”
过去几年,像Codex、Claude Code这样的数字智能体已经证明:大模型可以理解目标、拆解任务、调用工具,并根据反馈不断调整计划,直到完成任务。现在,这套思路正被带进物理世界。

GPT-6 Astra已经开始接受真实机器人操作测试,但物理世界和代码环境完全不同——环境持续变化、状态无法完全观测,动作一旦执行就很难撤销。抓取、装配、插拔这些精细操作,更需要专门的模型和控制能力。

机器人要真正干活,光“想明白”不够,还得“看得见、做得到、反应快”,并且“记得住”。

今天,由清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施RPent正式开源。它把通用大模型的任务理解与规划能力、VLA等专家模型的精细操作能力,以及记忆、工具和机器人接口连接起来,形成从感知、决策、执行到反馈纠错的完整闭环。

在LIBERO-PRO基准测试中,RPent达到了92.6%的任务成功率,并将端到端任务完成速度优化7倍以上。开源代码已发布在GitHub:https://github.com/RLinf/RPent

真机演示:任务变了,机器人也能跟着变

RPent的真机视频展示了几个开放式任务:机器人把钢珠倒入碗中、双臂协同擦拭盘子、主动移开遮挡物找到藏在碗下的勺子。
关键在于,这些不是为每个场景单独训练的专用策略。机器人开始从“执行学过的动作”转向“理解任务、调用能力,并根据环境变化调整行动”。
比如,当任务变成“将干净餐具放入纸箱”时,面对同一只蓝色盘子,冻结的VLA模型只会沿用训练时的动作,错误地把它放进金属篮;而RPent中的智能体会先观察当前环境,再根据新目标选择放置位置。如果视觉定位出现偏差,它还会检查结果、排除错误目标,并重新定位手中的盘子。
另一个任务中,机器人需要读取瓶身和袋子上的品牌标签,把不同饮料放进对应袋子。抓起瓶子后,它会小幅试抬确认夹持稳定;当原有运动路径不可行时,再调整腕部姿态继续执行。
面对被碗遮挡的勺子,机器人不会直接尝试抓取,而是先移开两个碗,让目标重新变得可见、可达。这已经不是一个预先写死的动作序列,而是一个完整的“观察-判断-执行-纠错”闭环。
最后两个任务展示了RPent对已有能力的复用:把“拿起并放置容器”的技能重新组合用于倾倒钢珠;把抓取动作与双臂协同、持续接触组合起来,完成持盘、擦拭和收纳。
探索成功后,RPent会把经过验证的任务逻辑沉淀为任务卡(Task Card)。再次执行时,可以启用Flash Mode,通过任务卡直接复用这套流程,只根据当前视觉状态做必要调整,避免每一步都重新调用大模型,有效降低执行延时。
这套Demo想展示的不是“机器人又学会了几个动作”,而是更重要的问题:当机器人走向开放世界,新的任务、物体和障碍不断出现时,它能否像人一样将已有技能重新组织起来,完成训练分布之外的任务?
两条技术路线之外的新思路
当前具身智能发展呈现两种不同路线。
一条是纯VLA端到端:用一个视觉-语言-动作模型直接吃下观测、吐出动作。这种方法在精细操作上表现很好,但一旦任务变长、语言指令变复杂、场景被扰动,性能就迅速退化。
另一条是纯大模型Agent(如CAP-X这类工作):随着GPT-6这一代通用模型对具身任务的覆盖率快速提升,大模型直接输出动作已经能跑通不少任务。但它在亚厘米级精度、执行时延和“越用越强”这几件事上仍有明显短板。
RPent并不是在两种路线之间折中,也不是让某一个模型包办从任务理解到机械臂控制的全部工作,而是把具身智能拆解为不同层次的能力,让不同模型各自承担最擅长的事情:
- 通用大模型负责理解任务、制定计划
- VLA、WAM等专家模型负责高精度动作执行
- 记忆系统沉淀经验,推动智能体持续优化
- 框架负责连接模型、工具与真实环境,形成闭环
它们共同形成“观察-规划-执行-反馈-再规划”的闭环,让智能体从一次性执行任务,走向在真实世界中持续成长。这套算法源于团队7月份提出的Harness VLA工作。
开放的模块化架构
RPent采用开放的模块化设计,将系统划分为用户层、智能层、接口层和环境层四大层级。
在用户层,可以通过交互式命令行或Web Dashboard下达任务,并查看视觉输入、推理过程和动作轨迹。
智能层中的规划器结合基础模型、Memory与工具库拆解任务,动作原语则把VLA、WAM和程序化技能封装成可调用工具。
在环境层和接口层,机器人控制、模型服务和仿真环境可以独立部署,通过轻量级通信连接。上层任务逻辑不必绑定某一种机器人或仿真器,新增设备只需实现标准动作、状态与环境接口。
目前RPent已覆盖LIBERO-PRO、RoboCasa、RoboTwin、RoboDojo等仿真环境,以及Franka、双臂Franka、YAM、SO101等真实设备。
用户层:智能体交互入口
用户层提供类似Claude Code/Codex的交互式CLI,以及可选Web Dashboard。用户可以下达任务指令,并实时查看智能体推理过程、视觉输入和动作轨迹,实现对智能决策过程的可观测及实时交互。
智能层:任务规划与能力调度中心
智能层由Agentic Planner和Action Primitive组成。Agentic Planner结合基础模型、Memory和Tool Library,实现任务理解、规划与工具调用,并通过Agentic Loop完成“规划 → 执行 → 反馈 → 记忆更新”的持续优化。
Action Primitive将VLA、WAM等学习型操作模型,以及Code as Policy等程序化技能统一封装为标准工具,使大模型负责复杂任务理解与规划,专家模型负责高精度动作执行,从而兼顾泛化能力与操作精度。
接口层:统一连接模型与机器人
接口层将智能体决策转换为机器人可执行指令,为不同设备提供统一调用接口,包括动作执行、状态读取、环境渲染和设备复位等能力。
无论是真实机器人还是仿真平台,上层Agent、提示词和工具均无需针对设备重新开发,实现跨机器人、跨环境迁移。
环境层:连接真实与仿真世界
环境层负责任务执行,目前已支持LIBERO-PRO、RoboCasa、RoboTwin等仿真环境,以及Franka、双臂Franka、YAM等真实设备。
新增机器人只需作为独立模块接入robots/目录,即可被框架自动识别和调用。此外,智能层与环境层采用独立进程架构,支持模型服务、机器人控制和仿真环境的独立部署、迁移与重启,为持续研发和长期运行提供工程保障。
通过模块化架构与统一接口设计,RPent不绑定单一模型或机器人,而是构建了一个开放、可扩展的具身智能基础设施,让不同模型、技能与硬件能够灵活组合、高效协同。
统一接口连接物理世界
在数字世界中,Agent的能力边界很大程度上取决于它能调用哪些工具。MCP的出现,让大模型可以通过统一的工具协议访问搜索、代码、数据库等数字资源。
但进入物理世界后,问题变得复杂得多。机器人、相机、传感器、仿真器和各种物理设备都有各自的接口。即使是完成同一个任务,不同机器人也可能使用完全不同的控制方式。
如果每接入一种设备都需要重新开发一套Agent,那么智能体很难真正规模化扩展。
RPent将“工具-机器人-环境”进一步抽象,通过分层接口把智能决策与物理执行解耦。将“大模型决策”与“物理设备执行”连接起来,实现智能体、工具和硬件之间的统一协作。
RPent用三层接口把智能决策与设备执行分开:
- MCP统一描述可调用能力。无论底层是VLA、程序化技能还是其他工具,规划器都通过统一定义进行选择和调用。
- RPC连接工具、模型服务与机器人环境,使真实设备、仿真平台、本地进程和远程服务可以独立部署。
- MHS面向更广泛的物理设备提供统一读写与控制抽象,使智能体未来能够从机器人扩展到实验仪器、家庭设备和工业系统。
在开头的真机视频中展示的Franka和YAM的操控,都来自于统一接口。通过MCP、RPC与MHS的分层设计,RPent正在构建一套连接模型、工具、机器人与物理设备的统一接口体系,让智能体能够像调用数字工具一样调用物理能力。
记忆机制:让一次成功变成永久能力
能完成一次任务,并不意味着真正拥有了这项能力。在物理世界中,试错的成本远高于数字环境。一次失败的抓取可能需要重新布置场景,一次错误操作甚至可能造成设备损坏。
如果每次执行结束后经验随即消失,智能体就只能反复从零开始。
RPent的Memory系统希望改变这一点:让一次探索产生的经验,成为未来任务执行的基础。
RPent将经验按复用范围组织为三层记忆,并为记忆记录适用范围、类型、可信度和支撑证据。新经验需要经过验证后才能提高可信度;相互冲突的记录会被保留和隔离,避免偶然成功污染已有能力。
记忆机制中包含Recipe,也就是可迁移的任务方案,而不是某一次执行中的固定坐标。例如,系统可以记录“先根据任务描述和当前画面确认目标,再调整夹爪位置,调用VLA完成抓取,并检查抓取结果”的操作过程。
当物体位置改变时,智能体重新观察环境,再复用相同逻辑,而不是直接沿用原来的坐标。探索模式允许更新记忆;评测模式只读使用已经冻结的经验,使演进过程更加可控。
在LIBERO-Pro Goal实验中,引入记忆机制后,RPent在任务扰动环境下表现出明显提升:在位置交换任务中,成功率从31.0%提升至87.0%。
此外,RPent支持记忆资产分发。一次探索产生的经验可以同步至其他智能体,使单个智能体获得的能力能够成为整个系统持续进化的基础。
Flash Mode:跟上物理世界的节奏
将大模型引入机器人控制回路,为智能体带来了更强的理解和规划能力,但也带来了新的挑战。大模型推理速度通常远慢于机器人动作执行速度。在物理环境中,等待模型生成下一步决策可能成为整个系统的主要延迟来源。
RPent并不是单纯追求更快的大模型,而是通过架构优化减少不必要的调用,让智能体运行节奏更加贴近真实世界。
在实际应用中,大量机器人任务具有较强重复性:任务目标和执行逻辑基本稳定,变化的主要是物理位置、姿态和环境状态。对于这类任务,如果每次都从头进行完整规划,无疑会产生大量重复推理。
RPent通过Flash Mode来解决Agentic Planner应用于真机的加速问题,其核心技术载体是任务卡(Task Card)。
在探索阶段,RPent允许规划器调用大模型、VLA和程序化技能,尝试不同动作组合,并将成功且经过验证的任务流程压缩为Task Card。Task Card保存任务阶段、动作原语、关键目标与检查条件,不保存只能在一次场景中使用的固定坐标。
进入Flash Mode后,系统优先按照Task Card执行:视觉模块重新定位关键物体,执行模块根据当前状态调整动作;只有在检查失败、环境偏离或流程无法继续时,才重新调用规划日晚间处理。这样既保留了大模型应对变化的能力,也避免在稳定流程中反复进行高成本推理。
在LIBERO Object的200次评测中,开启Flash Mode将平均执行时间从283.6秒降低至40.9秒,在成功率仅下降3.5个百分点的情况下,实现约7倍加速。这也是开头真机视频中Flash Mode的技术含义:把探索得到的成功方案转化为可以快速复用、同时保留环境适应能力的执行流程。
Leaderboard:展示协同效果
社区当下对于Agentic Planner存在相同的问题:到底进展到哪一步了?
为了回答这个问题,RPent推出了Leaderboard板块,采用不同技术路线、不同基座模型的方案在性能和延时的对比一目了然。
GPT-6 Astra在RPent中展现出突出的长程任务与扰动适应能力。在更强调指令变化、布局变化和长程执行的LIBERO-Pro上,RPent/GPT-6 Astra达到92.63%,相比图中第二名RPent/Opus-4.7的82.4%高出10.23个百分点;相比π_RLinf的50.0%高出42.63个百分点。此外,开启了Flash Mode的RPent明显降低了延时。
在RoboCasa365 Target50的厨房长程任务中,RPent/GPT-6 Astra达到59.20%,位列图中第一,高于RPent/GPT-5.5的57.1%。这说明更强的基础模型经过RPent的工具组织、记忆与执行闭环后,能够有效转化为物理任务能力。
其余榜单也显示了RPent对不同模型与执行配置的兼容性:RPent/Opus-4.7在LIBERO达到96.0%;RPent/GPT-5.5在RoboTwin达到62.4%,均处于图中领先位置。
结果更值得关注的不是某一个模型单独完成了全部控制,而是通用模型、专家模型、工具和记忆系统可以在同一框架内协同发挥作用。
构建物理世界的智能基础设施
从Codex、Claude Code到RPent,AI正在从“在数字世界完成任务”,走向“在物理世界完成任务”。
当智能体走向真实世界,变化的不只是模型能力的边界,也包括支撑这种能力运行的基础设施形态。
机器人需要看见环境、理解任务、调用不同能力、完成精细动作,还需要根据真实反馈不断调整策略,并把已经验证过的经验保留下来。
所以,围绕这一完整过程来组织智能体系统的RPent,并非只是一个开源的“让大模型控制机器人”的框架,而是一套能够连接模型、工具、机器人与环境,并支持智能体在真实世界中持续运行、积累经验和不断递归演进的智能中枢。
从一次任务,到一类任务;从一次执行,到持续进化。RPent所代表的,正是大模型真正走进物理世界之后,需要重新构建的下一层基础设施。