京东开源EchoWM:支持音视频同步生成的可交互世界模型
EchoWM 是什么
EchoWM 是京东探索研究院近期开源的一个交互式视听世界模型。它允许用户通过键盘操作(比如 WASD)在 AI 实时生成的虚拟环境中自由移动、转身或折返,同时画面、空间关系和声音(包括环境音、背景音乐、人物语音)会持续同步,即使经过多轮长时间交互,整体一致性也不会明显“跑偏”。
这个模型延续了 JoyAI-Echo 系列对原生音视频联合生成的支持,并在此基础上强化了交互能力。在官方公布的 WBench 导航评测中,EchoWM 在 158 个测试案例里平均得分 81.7,排名第一。
主要功能
EchoWM 的核心能力围绕“可进入、可探索、有声音”的 AI 世界展开:
- 实时可探索世界生成:用户输入方向指令后,场景会动态展开,而不是预渲染好的固定片段。
- 原生音视频联合生成:视频(720p)和音频(环境声、语音等)在同一框架内同步生成,声音随画面内容自然变化。
- 双视角支持:既支持第一人称(镜头即观察者),也支持第三人称(镜头自动跟随人物或车辆等主体)。
- 多轮长时程延续:以上一轮生成结果的末尾作为下一轮的上下文,确保场景布局、主体外观和声音风格在多次交互后仍保持连贯。
- 评测表现领先:在 WBench Navigation 基准测试中,一致性与交互性指标均优于现有竞品。
技术实现细节
统一相机意图接口
传统做法往往为不同视角设计不同的控制逻辑,而 EchoWM 用一套统一的“相对6自由度(6-DoF)轨迹”来描述相机运动。具体来说,用户的 WASD 按键被映射为相对于初始位姿的连续运动轨迹。
- 在第一人称模式下,这条轨迹直接代表观察者的移动路径。
- 在第三人称模式下,模型通过训练数据自动学习“主体移动—镜头跟随”之间的耦合关系,无需额外提供角色轨迹或预设相机参数。
值得注意的是,轨迹信息只注入视频生成分支,音频则完全由画面内容驱动,实现自然联动。
世界数据引擎
为了训练出能应对多样场景的模型,团队构建了一个“世界数据引擎”,整合了四类数据源:
- 内部采集的游戏实机画面(gameplay)
- 人类玩家录制的真实操作录像
- Unreal Engine(UE)仿真的合成数据
- 普通互联网上的公开视频
这些数据的相机轨迹尺度差异很大。为此,团队采用“全局尺子”策略:以所有轨迹中最大平移幅度的第90百分位数作为归一化基准。这样既保留了不同轨迹间的相对位移差异,又避免了因分段定标导致的速度突变问题。
渐进式四阶段训练
模型训练分为四个阶段,逐步提升控制精度与生成质量:
- 音视频预训练:使用富含视听内容(AV-rich)的数据进行基础训练,建立基本的生成能力。
- 轨迹分支微调:冻结主干网络,仅训练轻量级的轨迹控制分支,强化对用户指令的响应。
- 联合微调:用高质量、高可控性的数据进行低学习率联合优化,平衡控制可靠性与视听质量。
- 自回归后训练:将模型改造为因果分块生成结构,结合 Teacher Forcing 和短时程 Self-Gradient Forcing,让模型学会基于自己生成的历史继续推理。最后通过分布匹配蒸馏,将采样步骤压缩至四步,并配合 sink-plus-FIFO 缓存机制,在控制显存开销的同时支持长时程流式交互。
如何使用 EchoWM
目前 EchoWM 已在 GitHub 开源,使用流程如下:
- 克隆代码库:
注意:git clone https://github.com/jd-opensource/JoyAI-Echo cd JoyAI-Echo/echo_wm/echo_wm/与长视频项目echo_longvideo/是两个独立模块。

创建 Python 环境:
conda create -n echo-wm python=3.11 conda activate echo-wm安装依赖: 先安装 PyTorch 2.9.1(CUDA 12.8 版本),再运行:
pip install -r requirements.txt可通过
torch.cuda.is_available()验证 GPU 是否可用。下载模型权重: 使用 Hugging Face CLI 下载主模型:
hf download Echo-Team/Echo-WM同时还需下载 Gemma 3 文本编码器(需先在 Hugging Face 页面接受许可并登录):
hf auth login hf download google/gemma-3-...运行示例验证: 官方提供了多个完整案例,例如:
python scripts/run_wm_case.py --case examples/wm_cases/0010成功运行说明环境配置正确。
自定义生成: 调用
inference_wm.py,传入首帧图像、六字段提示词和动作指令串(Action DSL)即可生成带声音的视频。编写动作指令: Action DSL 格式为
<按键>-<帧数>,多个动作用逗号连接。例如:w-60,a-60:前进60帧,然后左移60帧w-30,i-15,k-15:前进30帧,抬头15帧,低头15帧 支持的按键包括 w/s/a/d(前后左右)和 i/j/k(上下左右视角调整)。
核心优势
相比同类模型,EchoWM 的几个关键突破在于:
- 真正的视听一体化:多数世界模型只生成画面,而 EchoWM 在同一框架内原生生成视频与多类型音频,且声音与画面事件严格同步。
- 统一控制逻辑:一套接口同时支持第一人称探索和第三人称跟随,简化了交互设计。
- 长时程稳定性:通过自回归后训练和缓存机制,多轮交互后仍能保持场景、主体和声音的一致性。
- 评测领先:在 WBench 上得分 81.7,用户研究显示 63.13% 的参与者更偏好 EchoWM,远超 HappyOyster(27.06%)。
应用场景
虽然目前仍是研究原型,但 EchoWM 的能力指向多个实用方向:
- 游戏原型快速验证:开发者可先进入 AI 生成的关卡试玩,评估空间布局、路线设计和镜头体验,再决定是否投入正式开发。
- 互动叙事内容:剧情可根据用户选择动态分支并持续生成,替代传统预制素材,适用于互动剧、互动小说等。
- 沉浸式广告或影视:观众不再只是“看”画面,而是可以“进入”其中自由探索,带来更强的参与感。
- 低成本虚拟游览:博物馆、景区、房产样板间等场景可快速生成可漫游的数字版本,无需逐帧建模或拍摄。
- 数字人协同表演:人物的语音、动作与动态环境、镜头运动、背景声音协同生成,适合虚拟主播或企业数字员工等场景。
与竞品对比
在当前的交互式世界模型中,EchoWM 与 HappyOyster 是主要对标对象。两者都支持音视频联合生成和实时交互,但 EchoWM 在几个关键维度上更进一步:
- 视角控制:EchoWM 明确支持第一/第三人称双模式,且用统一接口驱动;HappyOyster 虽有“导演模式”和“漫游模式”,但具体控制接口未完全公开。
- 长时程能力:EchoWM 通过自回归后训练和缓存机制显式优化了多轮交互的一致性;HappyOyster 对此细节披露较少。
- 评测分数:WBench 平均分 81.7 vs 76.8,用户偏好度 63.13% vs 27.06%,差距显著。
总的来说,EchoWM 不只是“能动的画面”,而是一个具备空间感知、声音反馈和长期记忆的可交互世界雏形。虽然离大规模商用还有距离,但它为未来的人机交互提供了一个值得期待的方向。