在2026年,交互式世界生成面临新的挑战:AI生成的环境能否承受用户的持续探索?仅仅创造出真实的门面,仍然只是开始。随着用户的每一步前行,AI需保持场景的一致性;用户走过走廊再回望时,之前的环境仍应如初。每一次用户的移动和转向都是对模型记忆能力的考验,这使得世界模型的竞争,从画面质量扩展至对持续交互的可靠性要求。
过去一年,技术进展让这一领域的地图更加清晰。谷歌DeepMind的Genie 3展示了实时探索和分钟级的一致性,而英伟达的SANA-WM则将快速生成、精准的相机控制及高效能结合起来,World Labs的Atlas则通过空间上下文支撑指定视角下的新视角生成。
当探索触及视听体验时,新的问题随之而来:用户更改路径或视角时,音效如脚步声、环境声和人物对话是否能够与画面保持一致?因此,对沉浸式内容的世界模型而言,视听生成与交互控制的整合尤为重要。 qy球友会官网
在9月9日的京东全球科技探索者大会上,京东探索研究院展示了JoyAI-Echo系列的最新进展,超长音视频生成模型升级为JoyAI-Echo 1.5,并同时发布了面向交互视听世界生成的JoyAI-EchoWM,并公开其代码。该模型在保留之前JoyAI-Echo原生音视频生成能力的基础上,能够实时响应用户操作。
用户现在可以在场景中第一人称视角下自由移动,切换到第三人称视角时,摄像机与主体之间的运动也保持协调。在经历多轮长时间操作后,整体画面、空间关系和主体状态仍然稳定连贯。JoyAI-EchoWM构建了一个真正可以进入、操控和探索的视听一体化世界。
在158个WBench导航案例的评测中,JoyAI-EchoWM获得了81.7的平均分,并在一致性和交互性等指标上表现出色。相较其他模型,JoyAI-EchoWM结合了跨视角控制与持续视听体验,提供了更强大的生成内容能力。 qy球友会官网
这一技术如何在交互中体现,用户按下操作键后,画面与声音的变化便是直接的反馈。传统的视频生成在任务完成后基本停止,而在允许用户自由移动和改变视角的情况下,许多小错误都可能显现出来。因此,交互对视频生成提出了更高的要求:需根据用户操作,持续生成与之前内容相关联的画面。
JoyAI-EchoWM通过共用同一套交互接口,使得画面中的主体、空间关系和声音能够和用户的探索同步延续。为了实现这样的交互,模型需要让不同视角的控制方式统一。第一人称视角中,镜头与观察者的眼睛接近,运动相应跟进;而在第三人称视角下,镜头需适应主体的运动,并保持画面的构图协调。
为了简化管理,JoyAI-EchoWM引入了统一的“相机意图”表示,描述用户希望镜头如何移动和观察场景。用户的方向键操作被映射为相对初始位置的连续6-DoF轨迹,即镜头在三维空间中的移动和转动,从而在不同视角下发挥不同的作用。 qy球友会官网