京东开源可交互视听世界模型 EchoWM,长视频生成突破 10 分钟

0 阅读

长视频生成迈过 10 分钟门槛

9 月 9 日的京东全球科技探索者大会(JDD)上,京东探索研究院一口气公布了 JoyAI-Echo 系列的两个关键进展:JoyAI-Echo1.5 和开源模型 EchoWM。前者把 AI 生成音视频的时长推到了 10 分钟以上,后者则让生成内容从“被动观看”变成“主动探索”。

JoyAI-Echo1.5 的核心是音视频 Memory Bank 架构。这个设计解决了长视频生成中最头疼的问题——人物形象、声音特征和剧情线索在几十秒后就开始漂移甚至崩坏。有了 Memory Bank,模型能在多镜头切换、长时间推进中牢牢“记住”关键元素,保证一致性。

技术指标上,它通过长视频后训练把推理速度最高提升了 7.5 倍。在 480P 分辨率下,仅用两张 H200 显卡就能做到平均每秒生成 24 帧,实现 1:1 的等时生成——也就是说,生成一分钟视频大约只需要一分钟计算时间。

配套的 Director Agent 则负责更高层的创作任务。你只要给一段自然语言描述,比如“一个女孩在雨天的咖啡馆里回忆童年”,它就能自动规划故事节奏、安排分镜、调用生成模型、审核内容质量,最后拼成一段完整的成片。这相当于把导演、剪辑和质检的角色打包进了 AI 工作流。

image.png

可交互的世界模型:能进、能改、能连续探索

如果说 JoyAI-Echo1.5 解决了“能看多久”的问题,那 EchoWM 要回答的是“能不能进去玩”。

过去的世界模型通常走两个极端:一类支持用户实时操作,比如用键盘控制角色移动,画面会随之变化,但环境音往往是静音或循环播放的固定音效;另一类能联合生成画面和声音,但一旦生成完成就无法再干预,用户只能当观众。

EchoWM 把这两条路缝在了一起。它原生支持 720P 视频与环境音、背景音乐、角色语音的同步生成。更关键的是,声音会随着场景变化、摄像机运动和主体行为动态调整——比如角色走进隧道,回声会变强;镜头拉远,人声会减弱。

交互方面,模型引入了统一的“相机意图”机制,同时支持三种控制模式:第一人称视角自由漫游、第三人称下摄像机与角色协同移动,以及多轮连续探索。这意味着你可以先以主角身份走进一个虚拟房间,然后切到旁观视角观察整体布局,再回头继续操作,整个过程不需要中断生成流程。

在 WBench Navigation 这个专门评测多轮导航能力的基准上,EchoWM 和它的轻量版 EchoWM-Flash 包揽了前两名。其中 EchoWM 在包含 158 个多轮交互案例的综合榜单上排名第一,证明它在复杂、连续的探索任务中确实更稳。

从内容生成走向动态环境交互

这次 JDD 上,京东没只盯着单点模型,而是亮出了整套 JoyAI 基础模型矩阵。能力覆盖图像视频生成、多模态理解、实时交互、世界建模、智能语音和具身操作。目标很明确:把 AI 从静态内容生成推向对动态物理环境的感知、模拟与交互。

现场还预告了新一代音视频基础模型 JoyAI-Video,计划 10 月正式发布。它重点强化了四个方向:商业广告视频的生成质量、物理规律的真实呈现(比如液体流动、布料褶皱)、第一人称视角的沉浸感,以及多镜头之间的连续叙事能力。应用场景直指电商广告、短剧创作和具身智能的虚拟演练。

为了支撑这些模型研发,京东同步开放了 EgoLive 真实数据集、JoyAI-Sim 仿真转换工具链和底层大模型基础设施。这套组合拳打通了从真实世界采集、仿真环境构建到模型训练的全链路,算是把“数据—仿真—模型”的闭环真正搭起来了。

五大行业智能体落地

技术再炫,最终得看能不能用。京东这次也集中展示了产业侧的进展,覆盖零售、物流、医疗、工业和政务五个领域。

零售多模态模型已经能处理商品图搜、智能导购对话和素材自动质检。比如用户上传一张模糊的商品图,系统能精准匹配 SKU 并推荐相似款;后台还能自动检测广告图是否符合平台规范。

物流超脑 3.0 用 Agentic 框架把决策、业务流程和物理执行串在一起。从订单分配、路径规划到无人车调度,整个链条由多个智能体协作完成,而不是靠预设规则硬编码。

医疗方面,京医千询 3.0 强化了影像分析能力,能辅助识别 CT 或 MRI 中的异常区域,同时支持模拟问诊和可信推理——不是简单输出诊断结论,而是给出判断依据和置信度。

工业大模型则扎进专业场景,比如根据设备参数推荐最优选型方案、生成维保操作指引,甚至能理解 CAD 设计图并提出结构优化建议。

政务大模型主要服务政策咨询、智能公文处理和政务数据分析。市民问“新生儿补贴怎么申请”,它能结合地方政策自动拆解步骤;内部还能辅助撰写会议纪要或生成统计报告。

开源与生态

值得注意的是,EchoWM 已经开源。这意味着研究者和开发者可以直接下载模型权重,在自己的数据或场景上做微调。京东没公布具体开源协议,但从命名和发布节奏看,大概率会采用类似 Apache 2.0 的宽松许可,鼓励社区二次开发。

相比之下,JoyAI-Echo1.5 和即将发布的 JoyAI-Video 目前仍是闭源产品,主要通过京东云 API 或行业解决方案提供服务。这种“核心能力闭源+前沿探索开源”的策略,既能保护商业利益,又能吸引学术界参与生态建设。

整体来看,京东这次的 AI 布局有两个明显转向:一是从单模态生成走向多模态、长时程、高一致性的内容生产;二是从“生成即结束”走向“生成可交互、环境可探索”。这背后其实是在为具身智能和虚拟世界铺路——无论是电商的虚拟试穿,还是物流机器人的仿真训练,都需要一个既真实又可控的动态环境。

而把长视频生成、世界模型和行业智能体放在同一次大会上发布,也说明京东不再满足于做“AI 工具提供商”,而是想成为连接数字内容与物理世界的操作系统级玩家。