逐际动力Oli vs Figure:人形机器人“大脑”路线之争与COSA架构解析

3 阅读

从Demo看本质:具身智能的“系统论”崛起

在2026年7月的科技圈,一场关于人形机器人核心竞争力的讨论正在悄然升温。刚刚完成2亿美元Pre-IPO轮融资的逐际动力,没有选择传统的资本叙事,而是直接甩出了一段全尺寸人形机器人Oli连续不间断完成家务的视频。这段3分钟的一镜到底实录,涵盖了从高处取衣、投放脏衣篓、归纳玩偶到搬箱、深弯腰拾物等一系列复杂动作。全程无远程介入、无分段剪辑,且机器人保持站立、蹲下、弯腰等自然体态,展现了极高的鲁棒性。

这一表现不仅让Oli成为中国首个全自主完成长程移动操作家庭任务的全尺寸人形机器人,更让其在全球范围内与Figure并列为该领域的两大标杆。然而,真正引发行业深思的并非视频本身,而是支撑Oli行动背后的技术路线差异。当硅谷巨头Figure凭借双系统框架和全栈闭源策略占据估值高地时,逐际动力提出了一种截然不同的观点:模型不是大脑,系统才是。这一“行业非共识”观点,正在重塑具身智能的技术范式。

告别“唯模型论”:为什么系统比单一大模型更重要?

过去几年,具身智能行业陷入了一种“唯模型规模论”的内卷之中。多数厂商试图通过扩大VLM(视觉语言模型)或VLA(视觉语言动作模型)的参数体量,来暴力破解物理世界的复杂性。这种思路的逻辑看似通顺:更大的模型意味着更强的泛化能力,从而拥有更聪明的“大脑”。

然而,在实际落地场景中,这种单一模型的局限性暴露无遗。机器人经常面临行动卡顿、环境适配性差、长程任务成功率低等问题。逐际动力创始人张巍指出,将大脑等同于单一模型是一种误导。在复杂的家庭非结构化场景中,机器人需要的不是一个全能但僵化的“天才”,而是一个能够管理记忆、调度资源、决策路径,并精准调用各类技能及运控能力的“操作系统”。

逐际动力定义的Embodied Agentic OS(具身智能体操作系统),正是基于这一逻辑。它不再依赖某一个孤立的大模型,而是将认知、技能、运控模块协同配合,与硬件联合优化。在这种框架下,即使是最先进的VLA模型,也仅被视为众多“技能”中的一种,而非整个大脑。只有当这些模块在系统层面实现高效协同,机器人才具备真正的智能。这种从“做模型”到“做系统”的思维转变,是具身智能走向成熟的关键一步。

COSA 0.5架构揭秘:复刻人类神经系统的三层设计

为了验证系统论的可行性,逐际动力在本次更新中完整展示了LimX COSA 0.5版本的三层技术架构。这套架构借鉴了人类神经系统的生物学逻辑,将功能解耦为S2认知层、S1技能层和S0运控层,分别在低频、中频和高频时间尺度上独立运行,通过收窄的接口实现高效协同。

S2认知层:低频审慎的“大脑皮层”

S2层运行在1Hz的低频尺度上,负责宏观理解、世界模型构建、逻辑推理及人机交互。这一层并不追求实时反应,而是像人类将军一样,在接到指令后深思熟虑,制定长程任务策略。它读取头部与手腕相机的视觉输入,结合语言指令,判断当前环境状态并分解任务步骤。S2层集成了VLM、LLM及世界模型,形成了一个带记忆与调度的操作系统。虽然它“想”得慢,但确保了任务规划的准确性和全局性。单独来看,S2层如同坐在轮椅上的霍金,智力超群但无法直接驱动身体。

S1技能层:中频调用的“肌肉记忆”

S1层运行在50Hz的中频尺度,负责将能力沉淀为可复用的技能集合。不同于大模型试图用一套数据解决所有问题,S1层强调技能的独立性与多样性。剥鸡蛋、开瓶盖、搬箱子等技能各自拥有独立的Data Recipe和训练方式,避免参数干扰。这种设计允许技能像搭积木一样渐进叠加,无需推翻重来。S2决定“做什么”,S1则回答“用什么技能做”,按需调用最合适的VLA或其他专用模型,确保动作执行的专业性与高效性。

S0运控层:高频执行的“小脑平衡”

S0层是整体系列的基石,运行在1000Hz的高频尺度,负责维持身体平衡并精准执行关节指令。其核心是逐际动力自研的LimX WBT全身运动基础模型。该模型仅约千万参数,却能在机端实时将上游的运动目标转化为协调的关节指令。无论S1和S2下达多么复杂的指令,S0都能在1毫秒内确保机器人不摔倒、动作平滑。这种设计体现了“没有小脑,长不出大脑”的理念,强调了底层运控对上层智能的支撑作用。

硬核实测:COSA与行业标杆的精度对比

在S0运控层的性能比拼中,LimX WBT与业界公开最先进的全身跟踪模型SONIC进行了直接较量。数据显示,LimX WBT在多项关键指标上占据优势:全身位置误差MPJPE为12.85mm(优于SONIC的13.75mm),平均关节角误差仅为1.5°(远低于SONIC的3.3°)。更重要的是,在代表动作平滑度的jerk指标上,LimX WBT在关节空间(115.2 vs 129.2)和基座朝向(90.3 vs 113.0)上均表现出更低的数值,意味着动作更少抖动、更贴近人类自然体态。

此外,团队引入真机强化学习(RL)迭代机制,通过专家遥操接管纠正失败案例,并将数据喂给奖励模型进行高效训练。这种“越用越聪明”的闭环机制,使得COSA系统在真实演练中持续优化,进一步拉大了与纯软件方案在稳定性与优雅度上的差距。

全球格局:东西方路线的分野与融合

纵观全球具身智能版图,玩家的技术路线呈现出明显的分化。Skild AI坚持纯粹的“模型即大脑”路线,试图用全能基础模型控制所有机器人;Flexion虽在架构上趋同于COSA的三层自主栈,但其核心仍依赖第三方硬件。相比之下,逐际动力与Figure代表了两种不同的系统化探索方向。

Figure更早提出System 1/System 2框架,并在长程真实任务演示上建立了先发优势,但其核心落脚点仍是模型内部切分,且采取全栈闭源策略。逐际动力则通过开源Humanoid FluxVLA Engine的训练与推理代码,构建开放生态,吸引开发者反哺技术。这种“软硬一体+开放生态”的组合拳,使得逐际动力在保持技术领先的同时,拥有了更广阔的发展空间。

值得注意的是,随着全行业从唯参数论转向务实的系统化路线,人形机器人的竞争已从“谁的模型更强”升级为“谁的系统更成熟”。Figure与逐际动力的竞争,实质上是两种系统化哲学在东西方文化背景下的碰撞。前者追求模型的极致泛化,后者强调系统的分层解耦与软硬协同。

展望:系统化路线的商业分水岭

具身智能的终局之战,不在于某个单一模型的突破,而在于能否构建出高成熟度、可迭代的大脑系统。COSA架构的提出,标志着行业开始告别“赌模型通吃一切”的幻想,转向让认知、技能、运控在真实身体里各就其位的务实道路。

系统化路线虽然从落地之初就注定要与物理世界不断对话、反复校准,但其优势在于可持续的平台化演进。通过分层解耦,任一层均可独立迭代,降低了维护成本与升级风险。同时,软硬件联合优化带来的运控策略壁垒,是纯软件公司难以复制的核心竞争力。

对于投资者与从业者而言,逐际动力与Figure的竞争只是开始。随着COSA 0.5版本的发布,我们看到的不仅是一个机器人的Demo,更是一种全新技术范式的成型。在不远的未来,谁能在系统化路线上率先跑通快速迭代闭环,谁就能在具身智能的商业化浪潮中占据头等舱席位。毕竟,对于操作系统而言,0.5版本只是起点,真正的成熟,往往隐藏在每一次弯腰拾物后的系统自检中。