机器人长程任务新突破:墨奇智能MoRA架构如何解决执行连续性难题
在2026年的世界机器人大会上,一个看似简单的演示却成为了技术焦点。当300多家机器人企业齐聚北京亦庄时,人们发现最引人注目的不再是那些翻跟头、跳舞、打拳的表演,而是机器人能否完成日常生活中那些看似微不足道却又复杂的任务——比如收拾房间。

墨奇智能(MORPHI)展台上的轮式机器人MORPHI KINO正在接受一项长达15分钟的家务实战测试。它需要穿越多个区域,将茶几上的物品收纳到指定盘子中,然后移动到冰箱前,发现缺货后打开冰箱门,将矿泉水放入并关门,接着进入洗衣区域,取出湿衣物放入烘干机,最后将烘好的衣物折叠整齐。

这些单独看来都是机器人行业反复展示过的技能,但真正的挑战在于将它们串联成一个完整的长程任务。这要求机器人在整个执行过程中始终记住任务目标,清楚哪些已完成、哪些还未完成,同时应对位置变化、执行偏差和环境干扰。

传统架构的局限性

当前主流的具身Agent采用"一个想,一个干"的分层双系统架构。高层认知模型通常由语言模型或视觉语言模型承担,负责理解需求、拆分任务、调度技能、处理异常情况,这一层被称为System 2。底层具身策略模型则结合视觉和机器人本体状态,将高层给出的任务指令转化为连续动作,即System 1。

这套分工确实解决了很多问题,让机器人有能力处理复杂的多步骤任务。但一旦拉长执行时间,短板就开始暴露。以收拾房间为例,高层模型可以快速规划出完整流程:清垃圾、整理桌面、检查冰箱、补货、处理衣物等。但负责执行动作的底层模型只知道当前该做什么(比如走到桌边抓起水瓶),却不清楚为什么要这样做、整个房间收拾到哪一步了、后面还有哪些事等着做。

此外,一旦环境发生变化或某步执行出现偏差,底层模型也无法准确判断任务如何继续,这时需要高层模型重新确认状态、调整规划并下达新的子任务。任务周期越长,这种来回调度越容易打断整个执行过程。

对于需要连续工作十几分钟甚至更久的机器人,如果每遇到一点变化都要等"大脑"重新规划,任务很难连贯起来。这就是传统架构在长程任务中面临的核心挑战。

Agentic-Native技术路线的创新

墨奇智能选择了一条不同的道路,让负责执行的具身策略模型更多地承担"自己把任务持续做下去"的能力。围绕这一思路,该公司提出了Agentic-Native技术路线,并推出了MoRA具身模型架构。

Agentic-Native的关键在于重新调整了具身Agent架构中System 1和System 2之间的能力分工。过去主要由System 2负责的目标维护、任务记忆和进度追踪,被进一步下沉到直接控制机器人行动的System 1中,使它们在持续输出动作的同时也能一直记住目标、保留上下文、判断当前任务进度。同时在超出能力范畴时,主动请求高层模型介入。

MoRA架构的核心能力
MoRA的全称是"MORPHI Reasoning & Autonomy",名字本身就点出了它的两个核心方向:Reasoning负责对环境、任务和行为的推理、规划和预测,Autonomy负责让机器人基于感知和推理结果做出决策并执行。
要实现长程执行,模型至少要具备三项核心能力。
首先是目标的持续维护。传统动作执行更容易围绕局部子任务展开,比如拿起矿泉水、移动到冰箱前、把矿泉水放进去等。这些指令单独看都很明确,但它们只是整个冰箱补货任务中的局部动作。在MoRA的设计中,System 1直接接收由文本、图像共同定义的结构化任务目标,并在连续执行过程中以这个Goal作为条件,这就是Goal-Conditioned Execution。
其次是执行记忆的保留。从时间尺度来看,长程任务中的"记忆"并不只有一种。当任务持续数分钟甚至十几分钟时,机器人要清楚总任务是什么、当前做到哪一步了、哪些工作还没有完成。MoRA在System 1内部引入长、中、短三种不同粒度的执行记忆,其中长期记忆保留整项任务的目标与进度、中期记忆维护步骤级执行状态、短期记忆负责控制层面的连续性。
最重要的是任务进度的判断。目标告诉机器人最终要做什么,记忆保存一路执行下来的上下文。机器人需要知道自己现在做到哪了,距离目标还差什么。MoRA内部形成了一个持续运行的"动作→状态→进度→调整"闭环,中间出现偏差时及时调整,并根据任务状态判断当前目标是否完成。
数据驱动的真实场景训练
MoRA在架构层面重新回答了"能力怎么组织"的问题,接下来还要回答这些能力"靠什么学出来"。对于长程任务,机器人面对的环境变化更多,任务跨度也更长,训练数据是否来自真实场景,以及是否包含完整的执行过程,都会直接影响模型最终能学到的能力。
当前行业很喜欢"百万小时"具身数据这样的叙事,但小时数够大并不等于质量高。一段只记录"标准成功动作"的数据与一段包含"环境变化、执行偏差、纠错乃至完成过程的任务轨迹",模型从中学到的信息并不一样。
长程任务需要学习任务执行过程中的连续因果关系和状态变化,为此墨奇智能构建了一套"Human-to-Robot Embodiment Transfer"的数据与训练方法。它以人类第一视角真实作业数据作为重要来源,再通过统一具身动作空间对齐人类行为和机器人动作,把其中相对独立于具体本体的任务知识迁移到机器人。
相比高度标准化的采集环境,真实作业数据包含更多实际场景中的物体状态、操作过程和环境变化,也更接近未来机器人要面对的任务分布。为了获取真实世界数据,墨奇智能自研了MORPHI Sense Kit数据采集系统,将采集设备带进酒店、商务公寓等真实商业场所,由一线作业人员直接产生作业数据。
采集回来的数据经过质检、场景重建和挖掘标注,再进入模型训练与评测;机器人在真机运行中产生的新数据又持续回流,进入下一轮训练和优化,由此形成了一套持续迭代的数据飞轮。目前,墨奇智能已经积累约3万小时真实场景数据,并计划在今年年底提升至15万-20万小时。
硬件协同的系统设计
再强的具身模型,也要通过机器人本体作用于真实世界。WRC现场执行任务的MORPHI KINO,正是墨奇智能为MoRA配上的本体。
作为一款面向家庭服务场景的轮式机器人,它没有强调某一项参数,更看重移动、躯干、双臂、视觉与触觉能力之间的协同。这种协同在家庭服务场景中尤为重要。收拾一个房间,机器人需要同时调动移动、操作、感知等多种能力:在茶几、冰箱、洗衣机之间穿行,根据不同操作高度调整姿态,识别物体位置和接触状态,完成开门、抓取、搬运、放置等动作。
MORPHI KINO采用四舵轮全向底盘,可以原地转向,底盘尺寸也能通过标准客房门和电梯。双臂各有7个自由度,单臂额定负载5kg。鱼眼相机、深度相机、激光雷达和指尖触觉传感器共同负责环境与接触状态感知。
另外,长程任务对机器人本体还有一个很实际的要求:不能干到一半就没电了。MORPHI KINO配备了两块540Wh电池,支持热插拔,实际可用续航不低于4小时。同时支持WiFi 6和5G双链路连接,方便状态回传和OTA更新。
技术发展的深层思考
墨奇智能这次围绕Agentic-Native和MoRA做的探索,触碰到了具身模型的一个基础问题:智能应该放在哪一层。当负责实际执行的System 1更能把控任务目标、记忆和进度,机器人可以在行动过程中持续推进任务;System 2则主要负责任务意图理解、全局规划和异常情况处理。
执行时间越长,越能凸显这种分工的价值。很多局部变化直接在执行层处理,任务也更容易推进下去。另外,当机器人从"完成一个动作"扩展到"承担一项连续的工作",具身智能的Scaling除了看模型大小、数据规模与场景覆盖,可能还需要多看一个维度:任务时长。对一个准备干"长"活的机器人来说,能够把能力维持多久,未来会越来越重要。
这种技术路线的转变反映了整个行业对具身智能本质认识的深化。过去我们更多关注机器人能否完成某个特定动作,现在开始思考机器人能否在复杂环境中持续完成一系列相关任务。这不仅是技术层面的进步,更是应用层面的重要突破。
行业影响与未来展望
MoRA架构的出现为具身智能领域提供了一个新的技术范式。它证明了通过合理的架构设计,可以让机器人在长程任务中表现出更好的连续性和稳定性。这种能力的提升对于家庭服务、商业清洁、仓储物流等应用场景具有重要意义。
更重要的是,这种技术路线为整个行业指明了新的发展方向。未来的具身智能发展不仅要关注单个技能的精度和效率,更要重视多个技能之间的协调和连续性。这需要在算法设计、数据收集、硬件配置等多个层面进行系统性的考虑。
随着技术的不断发展和完善,我们可以期待看到更多能够在真实环境中稳定执行复杂任务的机器人产品。这些产品将不仅仅是技术展示,而是真正能够为人类生活带来便利的实用工具。
从更宏观的角度来看,MoRA架构所代表的技术理念可能会推动整个机器人行业向更加实用化的方向发展。当机器人能够真正理解任务的上下文、记住执行的进度、自主调整策略时,它们就不再是一次性的工具,而是可以持续为人类服务的智能伙伴。