发生了什么
京东探索研究院在 JDD 全球科技探索者大会上开源了交互式视听世界模型 JoyAI-EchoWM,并同步放出轻量因果流式版本 EchoWM-Flash Preview。与只能输出单段成片的视频生成模型不同,EchoWM 的目标是「可进入、可控制、可探索」的生成世界:用户通过键盘或手柄移动与转向时,画面、环境音、音乐与人声持续保持几何与听觉上的一致性。
统一相机意图与四阶段训练
- 控制接口把离散按键映射为相对初始位置的连续六自由度相机轨迹,同一套意图流既可驱动第一人称漫游,也可驱动第三人称跟随镜头,无需为两种视角分别建模。
- 音频与视频联合生成:相机路径同时作为视觉分支条件,脚步、碰撞、对话与配乐随场景事件自然产生,不依赖独立的动作到音频控制器。
- World Data Engine 混合四类数据:游戏日志、人类实玩录像、Unreal Engine 位姿仿真与互联网视频;对缺失位姿的视频使用视觉几何方法恢复相机信息。
- 训练分四阶段:音视频持续预训练、轨迹控制训练、联合微调、自回归后训练;最后用分布匹配蒸馏把采样步骤压缩到 4 步,形成 Flash 版本。
- 长序列用 Sink 与 FIFO 缓存机制控制上下文成本:Sink 保存长期稳定的前缀信息,FIFO 保存最近生成内容,较早的历史 Token 按先进先出退出缓存。
评测表现与已知限制
在 WBench Navigation 的 158 个测试案例上,EchoWM Base 平均得分 81.7,一致性指标 89.8;Flash Preview 平均 81.0,交互性 87.9。在 SANA-WM-Bench 的 961 帧长时程测试中,Base 在简单与困难轨迹上分别取得 81.36 与 81.72。用户偏好两两对比中,相对 HappyOyster 的整体偏好比例为 63.13%,相对 LingBot-World-v2 为 46.50%,属于互有胜负。
官方同时说明了边界:目前没有显式的持久三维记忆,多轮探索后场景布局与外观仍可能漂移;Flash 版本属 Preview 阶段,官方对更长连续运行能力有明确限制。项目已在 GitHub 与 Hugging Face 开源,基础环境为 Python 3.11、PyTorch 2.9.1 与 CUDA 12.8,权重下载还需额外接受 Gemma 3 文本编码器的许可协议。
对应用方的意义
对电商展示、场景化营销与具身智能仿真而言,EchoWM 的价值在于把此前相对独立的能力——视觉生成、音频生成、空间控制与长时程状态延续——放进同一框架,并公开了数据构建、视听联合生成、自回归训练、蒸馏加速与缓存机制的完整链路。是否值得投入取决于具体场景能否容忍场景漂移:短时程交互演示已具备可用性,长时程生产级应用仍需等待持久记忆能力补齐。

