日冕远图万台级落地:物理AI如何用闭环打破量产僵局?
从Demo到量产:物理AI的“最后一公里”突围
在2026年的世界人工智能大会(WAIC)现场,具身智能的展位数量激增,人形机器人跳舞、机械臂精准叠衣等场景令人眼花缭乱。然而,在炫目的演示背后,产业界弥漫着一种理性的疲惫感:绝大多数项目仍停留在实验室演示阶段,真正能够签单进厂、形成规模化生产力的企业寥寥无几。这种“Demo多、落地少”的现象,折射出数字AI与物理AI之间的本质鸿沟——前者依赖算力 Scaling 即可无限复制,后者则必须直面真实物理世界的复杂性与不确定性。
正是在这样的背景下,一家成立仅4个月但阵容强大的初创企业——日冕开物,与全球服务器制造龙头远图未来宣布启动“超级工站”战略合作,并提出了“万台级部署”的雄心目标。这一合作并非简单的设备采购,而是旨在建立一套从工艺理解、任务规划到执行反馈、持续优化的工业具身智能完整闭环。其核心突破在于,日冕展示的系统能在通电后仅用半小时便完成对新环境的适配,这种极速适应能力背后,是其自研的LaMPA(Latent Masked Predictive Architecture)具身原生世界模型在发挥作用。
服务器制造场景之所以成为首个验证战场,是因为其兼具高复杂度与高价值。一块服务器主板涉及数百种精密元件的装配,对机器人的识别精度、力控反馈及环境适应性提出了极致要求。传统自动化设备在面对多型号、小批量的柔性生产需求时往往力不从心,而具备物理世界理解能力的具身智能机器人,则有望填补这一空白。日冕与远图的结合,一端是拥有真实工业场景和全栈算力解决方案的远图,另一端是提供物理世界基础模型及机器人系统的日冕,双方共同探索的是一条从“替代单一工序”向“全局智能协同”演进的新路径。
LaMPA架构:重构物理世界的理解范式
要实现机器人在真实工厂中的高效运作,仅靠提升模型参数量是不够的。日冕认为,传统的视觉-语言-动作(VLA)模型及早期的世界动作模型(WAM)本质上仍在学习表象映射,而非理解物理规律。这就好比让一个人仅通过观察窗外风景来推测室内温度,效率低下且极易出错。为此,日冕推出了LaMPA基础架构,试图通过统一跨模态隐空间来学习物理世界的底层规律。
LaMPA的核心创新在于其独特的三重表征机制。首先是“Environment”环境表征,负责环境重建与感知,使模型能够理解所处的空间布局;其次是“Ego”自我表征,统一抽象了导航移动、机械操作及本体控制能力,赋予模型掌控任意硬件本体的能力;最后是“Experience”先验表征,通过积累物体属性、可供性及专家知识,构建模型对物理规律的认知。这三者结合,构成了机器人当下状态的完整拼图:它所处的环境、对自身机器的认知以及积累的物理常识。
这种架构设计直接解决了传统模型在训练效率上的痛点。传统世界模型多采用像素级预测,需要处理大量无关背景信息,导致收敛缓慢。LaMPA则直接聚焦于隐空间,通过掩码扩散架构剔除冗余像素,仅保留任务相关的关键信息。这种“划重点”式的学习方式,不仅大幅缩短了训练周期,还显著提升了模型的泛化能力。在面对光照变化、工件尺寸偏差或摆放角度调整等多变工况时,LaMPA能够通过分布预测输出多种可行的交互方案,而非单一固定路径,从而展现出极强的容错能力和场景适应性。
超级工站:软硬一体的工业智能系统
基础模型的突破是前提,但将其转化为生产力才是关键。日冕并未选择单独售卖模型,而是推出了名为“超级工站”的软硬一体解决方案。这一系统并非单一机器人,而是一个由LaMPA物理世界模型、模块化机器人硬件及Workflow Agent组成的综合智能体。
Workflow Agent在这一系统中扮演着“大脑皮层”的角色,负责理解生产工艺流程,将标准作业程序(SOP)拆解为机器人可执行的任务序列,并完成方案仿真、生产执行及反馈优化。在硬件层,系统采用模块化设计,可根据不同工业场景灵活组合双臂机器人、移动平台及多种末端执行器。而在底层,LaMPA作为“操作系统”,提供感知、理解、决策和控制的全栈能力。
更值得注意的是其闭环进化机制。在强化学习阶段,系统利用WRM(世界奖励模型)判断任务成功与否,通过WPM(世界策略模型)输出动作指令,并将真实执行反馈持续回流至基础模型。这种“规划、测试、执行、反馈、进化”的闭环,使得超级工站能够随着运行时间的增加而不断自适应调整,支持跨工序的全局协同。与传统自动化设备换产需重新编程不同,超级工站具备持续自主学习优化的能力,能够标准化嵌入智能产线,越用越聪明。
数据闭环:具身智能商业化的核心壁垒
在数字AI领域,模型上线后即可快速复制服务海量用户。然而,物理AI的训练可能才刚刚开始。每一次机器人进入真实环境,遇到的新问题、积累的真实反馈,才是其进化的核心养料。因此,具身智能未来的竞争壁垒,不再仅仅是模型算法的优劣,而是谁能更早进入真实场景、构建更快的数据反馈闭环,并积累更大规模的真实交互数据。
工业数据与互联网数据有着本质区别。前者不仅包含视觉信息,还涉及机器人操作轨迹、力觉反馈、触觉信号、工艺经验及最终质量结果等多维数据。这些数据分散在产线各环节,采集难、标注难、治理更难。为了解决这一难题,日冕与远图正在构建一套覆盖采集、治理、训练和复用的工业级具身智能数据体系。
在采集端,日冕自研了触觉数据手套、头戴式采集设备等硬件,实现了生产过程中的无感伴随式数据采集,最大限度减少对原有生产流程的干扰。在治理端,双方建立了包括原始数据清洗、同步对齐、多模态融合及资产化处理在内的完整链路。最终,这些高质量数据被沉淀为操作数据集、技能库、仿真场景及模型检查点,反哺模型训练。这种“数据越多、闭环越快、模型进化越猛”的正向循环,构成了日冕难以复制的护城河。
迈向WMoS:具身智能时代的“Windows”
回顾PC时代,微软凭借Windows操作系统底层支持Word、Excel等上层应用,定义了数字交互的标准。在具身智能时代,日冕提出了“WMoS”(World Model as OS,世界模型即操作系统)的概念,试图打造物理世界的Windows。
在这一架构下,底层的世界模型负责理解物理规律、进行空间感知与逻辑推理,而上层的应用如“超级工站”则负责具体场景的标准执行。这种“思考”与“行动”的分离与协同,使得具身智能系统能够像软件应用一样,在不同硬件平台上快速部署和迭代。服务器产线的验证,不仅是为了展示机器人能否工作,更是为了验证这套操作系统在复杂工业环境中的可靠性与可扩展性。
按照规划,日冕与远图将在2027年完成百台级部署,并最终迈向万台级规模。这一进程标志着具身智能正式进入商业Scaling阶段。当机器人从实验室走向服务器工厂、半导体产线及物流中心,改变制造业的将不再是单台机器人的性能,而是一套能够持续学习、持续复制、持续进化的物理智能基础设施。日冕与远图的尝试,或许正是这一新纪元开启的关键注脚。