编辑|杜伟 进入到 2026 年,可交互世界生成面对一道更难的考题: AI 生成的世界能否经得起用户反复探索 ?一扇门画得逼真,只是起点。往前走,它要自然靠近;穿过走廊再回头,它还应该留在原来的位置。用户每一次移动、转身和折返,都在检验模型是否有能力记住已经生成的世界。 世界模型的竞争开始从画面质量延伸到持续交互中的可靠性。镜头要听从指令,场景要保持连贯,生成速度还要跟得上操作。这些能力需要同时成立,任何一处掉链子,都可能打断探索。 近一年来的技术进展,让这条主线更加清晰。谷歌 DeepMind 的 Genie 3 展示了实时探索与分钟级一致性,英伟达 SANA-WM 将分钟级生成、精确相机控制与更高效率结合了起来,World Labs 的 Atlas 通过空间上下文支持沿指定相机轨迹生成新视角,维持场景的几何关系。 当探索进一步触及到视听体验,新的问题随之出现:用户改变路线或者切换视角时,脚步声、环境声和人物说话声,是否能够与画面一起连贯地延续?因此,对于面向沉浸式内容的世界模型,视听生成与交互控制的结合更加值得关注。 9 月 9 日,在京东全球科技探索者大会(JDD)上,京东探索研究院发布 JoyAI-Echo 系列最新进展:超长音视频生成模型升级至 JoyAI-Echo 1.5; 同时发布并开源面向可交互视听世界生成的 JoyAI-EchoWM 。 该模型延续了此前 JoyAI-Echo 的原生音视频生成能力,在同一套框架中可以生成视频以及环境音、音乐和语音,同时能够实时响应用户操作。 现在,第一人称视角下,用户可以直接在场景中移动和探索;切换到第三人称视角,摄像机运动与主体运动也能保持协同。经过多轮、长时操作之后,整体画面、空间关系、主体状态依然能够很好地延续。 JoyAI-EchoWM 创造了一个真正可进入、可操控、可探索的视听一体化世界 。 在相关论文报告的 158 个 WBench Navigation 案例评测中,JoyAI-EchoWM 取得了 81.7 的最高平均分,并在一致性(89.8)和交互性(87.2)等指标上位于前列。同时四步因果流式版本 EchoWM-Flash 的平均分为 81.0,交互得分为 87.9,表明减少采样步数后,模型仍具备较强的导航响应能力。 相较于同一评测中的其他模型,Genie 3 强调实时探索与分钟级世界一致性;LingBot-World 2.0 通过因果生成与少步蒸馏推进长时程交互,并结合相机位姿和文本指令控制视角、动作及事件;HappyOyster 将音视频联合生成与实时交互结合,提供导演和第一人称漫游两种模式。 JoyAI-EchoWM 的路线特点,兼顾跨视角控制与持续视听体验,为可进入的生成内容提供了更完整的能力组合 。 这条技术路线如何体现在交互中,可以从用户按下操作键后,镜头、画面与声音的变化看起。 按下操作键,AI 世界用画面与声音回应你 普通视频生成,生成结束以后任务基本完成。即使主体位置略有漂移、空间关系偶尔变化,只要整体画面自然,人眼未必能察觉到。可一旦允许用户自由移动、切换视角,此前很多可以被视觉效果遮过去的小错误,在交互状态下都可能会变成 Bug。 这是因为,交互给视频生成增加了一层要求:模型需要根据用户操作,生成与此前内容衔接的画面。 JoyAI-EchoWM 如何解决这些问题呢?它的思路是通过共用一套交互接口,让画面中的主体、空间关系和声音随着用户探索一起延续。团队将这一支持持续导航并获得同步视听反馈的模型称为 面向「可进入生成媒体」的全模态世界模型 。 arXiv 论文:https://arxiv.org/pdf/2608.23189 项目主页:https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/wm/ GitHub 代码:https://github.com/jd-opensource/JoyAI-Echo 要实现这样的交互,首先需要统一不同视角下的控制方式。第一人称视角下,镜头接近观察者的眼睛,移动镜头对应自身移动。第三人称多了一层关系:镜头要跟随人物、车辆等主体,主体运动也要与画面构图配合。与此同时,用户按下的 WASD 方向键是离散指令,模型需要处理的相机位置和朝向却是连续变化的,为不同视角和控制设备分别设计接口会增加系统的适配负担。 为此,JoyAI-EchoWM 采用了统一的 「相机意图」(camera intent) 表示,用以描述用户希望镜头如何移动、 从什么角度观察场景。键盘操作经过固定映射,转换为相对初始位姿的连续 6-DoF 轨迹,也就是镜头在 3D 空间中的平移和旋转。 同一条轨迹在不同视角下承担不同作用。第一人称下,它直接描述观察者的运动;第三人称