智象发布具身世界模型HiDream-O1-Embodied,在扰动适应评测中登顶
智象发布具身世界模型 HiDream-O1-Embodied
2026年9月,智象未来(HiDream.ai)正式推出具身世界模型 HiDream-O1-Embodied。这款模型聚焦于机器人在物理世界中的感知、理解和执行能力,试图打通从环境输入到动作输出的完整链路。与以往侧重单一模态(如纯视觉或纯语言)的模型不同,HiDream-O1-Embodied 从架构设计之初就面向图像、视频、3D 场景和动作等多模态信息的统一表征,目标是构建一个能同时处理“看、听、想、做”的世界模型基座。

模型发布的同时,智象将其提交至具身智能评测平台 RoboColiseum 参评。结果很快公布:在最具挑战性的“扰动适应”(Robustness)子榜单中,HiDream-O1-Embodied 以平均分 0.692 的成绩位列第一。这个分数背后,反映的是模型在复杂、非理想环境下的稳定表现——比如光照突变、相机偏移、指令表述模糊或物体部分遮挡等现实场景中,它仍能可靠完成任务。

RoboColiseum:不是实验室考试,而是“意外”实战

RoboColiseum 是一个高保真仿真评测平台,专为具身智能模型设计。它不依赖抽象指标,而是通过78个具体任务,在接近真实世界的虚拟环境中测试模型能力。这些任务分为四个维度:指令跟随、空间理解、扰动适应和通用操作。
其中,扰动适应被公认为最难啃的骨头。平台会故意引入各种“干扰项”:改变背景纹理、调整光源方向、替换物体材质、偏移机器人初始姿态、移动摄像头位置,甚至对用户指令进行同义改写。目的很明确——检验模型是否只在干净数据下有效,还是真能在混乱现实中站稳脚跟。
HiDream-O1-Embodied 能在这个维度登顶,靠的不是单一技术优化,而是整套系统设计的协同效应。其核心支撑来自“原生全模态”理念,即所有模态从底层共享同一套表征空间,而非后期拼接。这种设计让模型在面对信息缺失或噪声时,能跨模态互补,维持整体判断力。
语言理解:穿透字面,直击意图
传统机器人系统对语言指令的理解往往依赖关键词匹配。比如,“把杯子拿过来”能识别,但换成“递我个杯子”或“帮我拿一下那个水杯”,系统可能就懵了。问题出在模型没有真正理解“意图”,只是机械地查找预设词组。
HiDream-O1-Embodied 则构建了一个更宽泛的等价指令空间。它训练时接触了大量表达同一意图的不同句式、动词变体和口语化说法。因此,无论用户怎么描述任务,模型都能剥离表面措辞,抓住核心动作目标。这种能力让它在 RoboColiseum 的指令多样性测试中表现稳健,不会因为一句话换种说法就失效。
视觉感知:多视角协同,避免单点崩溃
在真实部署中,机器人的视觉系统很少处于理想状态。摄像头可能因震动偏移,镜头可能沾灰,某个角度可能被障碍物挡住。如果模型只依赖单一视角,一旦该视角失灵,整个系统就可能瘫痪。
HiDream-O1-Embodied 采用多视角融合策略。它同时处理来自多个相机或传感器的数据流,并让它们相互校验和补充。即使某一视角暂时不可用,其他视角仍能提供足够的空间线索,支撑任务继续执行。这种设计将系统从“一处失灵、全局失效”的脆弱模式,转变为“局部受限、整体可用”的韧性架构。
高容错机制:在“不完美”中学会稳定
大多数AI模型在训练时使用的是高质量、无噪声的数据集。但现实世界充满不确定性:光线忽明忽暗、画面有污渍、视野被遮挡、信号偶尔中断。如果模型没见过这些情况,上线后很容易“翻车”。
HiDream-O1-Embodied 在训练阶段就主动引入各类非理想条件。比如,人为添加模糊、裁剪、色偏或遮挡,模拟真实运行中可能遇到的问题。通过反复暴露在“不完美”数据中,模型学会了从有限甚至矛盾的信息中做出合理推断。这种训练方式不追求在理想条件下刷出最高分,而是确保在复杂环境中依然能稳定输出。
更重要的是,这种容错能力具有泛化性。它不仅针对某一种干扰(如光照变化),而是能灵活应对多种组合扰动。这使得模型在 RoboColiseum 的综合扰动测试中表现出色。
数据生产:模型自己当“出题人”
上述能力的背后,离不开高质量数据的支持。而具身智能领域恰恰面临数据稀缺的困境——真实机器人采集成本高、周期长、场景有限。智象的解法是“模型+数据”双驱动策略,其中关键一环是“真实基座 + 生成增强”的数据生产范式。
具体来说,智象与动作捕捉公司诺亦腾合作,获取高精度真人操作数据作为“真实基座”。然后,利用其原生全模态模型,在严格遵守物理规律的前提下,对这些真实样本进行百倍级扩增。例如,一段“拿起水杯”的动作,可以生成在不同光照、不同桌面材质、不同背景环境下的变体视频,同时保持动作本身的物理合理性。
这一过程让模型不仅是“考生”,也成了“出题人”。它能根据自身弱点,主动生成针对性训练样本,形成“数据生成—模型训练—能力提升—新数据需求”的正向循环。这种内生增长机制,被认为是 HiDream-O1-Embodied 在扰动适应上表现突出的重要原因。
全模态模型矩阵逐步成型
HiDream-O1-Embodied 并非孤立产品。就在一个月前,智象发布了交互式世界模型 HiDream-O1-World,该模型在 WBench 评测基准的 Navi 分榜中以 80.9 分登顶。前者专注物理世界的“操作与执行”,后者侧重数字世界的“理解与推演”。两者共同构成智象原生全模态战略的两大支柱。
从早期的 HiDream-O1-Image(图像生成),到 HiDream-O1-World(交互推演),再到如今的 HiDream-O1-Embodied(具身执行),智象正在搭建一个覆盖感知、认知与行动的模型家族。这种演进路径呼应了其技术主张:下一代大模型的竞争,不在单一模态的极致优化,而在多模态的原生统一。
创始人梅涛曾表示,真正的世界模型需要同时具备全模态表达、因果推演和物理世界构建三大能力。HiDream-O1-Embodied 的发布,标志着这一构想从“模拟世界”向“真实世界”迈出了关键一步。未来,这套模型能否在真实机器人平台上复现仿真中的表现,将是检验其价值的最终试金石。