京东开源JoyAI-Echo WM登顶WBench,世界模型迈入“可进入”的全模态新阶段

过去两年,AI视频越来越逼真:输入一句话,就能生成电影感画面。但大多数时候,用户仍然是坐在屏幕外“看视频”,没有实时参与其中。世界模型正在改变这件事,它让一段被动播放的视频,变成一个可以持续进入与探索的世界。

真正做到“走进去”,行业一直面临一个难题:“能交互”与“有声音”往往是两条分开的路线。一类世界模型可以根据用户操作持续生成画面,但大多缺少自然声音;另一类音视频生成模型可以同步生成画面与声音,用户却很难持续进入并改变接下来发生的内容。

近日,京东开源实时可交互世界模型JoyAI-Echo WM,首次将这两种相对独立的能力在一套模型中打通:它既能根据用户的移动和视角变化持续生成世界,也能同步生成720P视频、环境音、音乐和语音,并支持第一人称、第三人称及多轮连续交互,让AI生成的内容从“可以看”,进一步走向“可以进入、可以操作、可以听见”的全模态新阶段。 

🔗项目页面:

https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/wm/

🔗代码仓库:

https://github.com/jd-opensource/JoyAI-Echo

四大亮点,让生成世界更“可进入”

01

角色会“开口表达”,声音、口型和动作一起生成

过去很多生成视频里的角色,即使“会说话”,也更像是先有画面、再配上声音。

JoyAI-Echo WM则让角色的表达从一开始就是完整生成的:指定角色按照台词开口时,口型、表情、身体动作和音轨会同步变化。无论是真实人物、动漫角色还是拟人动物,都能从画面中的一个形象,变成一个正在表达、正在与世界发生互动的角色。

02

视角跟着指令走,第一人称、第三人称都能控制

第一人称和第三人称原本对应不同的控制逻辑:第一人称更像用户自己走进场景,向前、后退或转向;第三人称还要处理镜头与角色之间的跟随关系。

JoyAI-Echo WM可以用统一的方式理解这些导航指令。无论用户是在第一人称里自己探索,还是在第三人称中跟随角色,镜头都能按照指令移动和转向,并同步生成连续的画面与声音。用户想从哪里看、往哪里走,生成的世界就会跟着变化。

03

长时间生成,人物外观、画面风格不“跑偏”

音视频一旦生成得更长,就容易出现一个常见问题:人物长着长着变了,颜色前后不一致,原本统一的写实光影或油画风格也逐渐走样。

JoyAI-Echo WM强化了长时间生成中的风格一致性。即使人物持续运动、镜头多次转向,模型仍能尽量保持人物外观、色彩体系和整体画面质感稳定,让既定的写实、油画等视觉风格在连续生成过程中不轻易漂移。

04

不用逐个下指令,世界也会自然继续发展

真实世界不会因为用户暂时没有操作就停在那里。路上的车会继续开,场景中的人物会继续活动,环境中的声音也会继续变化。

JoyAI-Echo WM也具备类似的持续生成能力。即使用户没有逐一指定场景中每个角色下一步该做什么,只是观察或改变视线,模型仍能继续联合生成画面和声音,让人物、角色和车辆自然活动下去。用户改变的是“怎么看这个世界”,而世界中的其他事物仍会继续发生,让生成场景不只是被动等待指令,而能够在观察过程中持续演化。

实测登顶WBench

两个版本包揽榜单前二

这些能力也得到了公开评测验证。在面向交互式世界模型的公开评测 WBench Navigation 中,测试涵盖画面质量、场景遵循、交互控制、一致性和物理合理性等多个维度。 JoyAI-Echo WM以81.6分排名第一,其中一致性达到89.8;经过四步因果蒸馏的快速版本 JoyAI-Echo WM Flash,综合得分仍以81.0分排名第二,交互能力更进一步达到87.9。两个版本包揽榜单前两名,EchoWM 已达到当前评测SOTA水平。 

在另一项SANA-WM-Bench中, JoyAI-Echo WM在短程简单轨迹和困难轨迹测试中的VBench得分分别达到83.91和83.96,均为参评模型最高。这意味着,模型不仅能“听懂往哪走”,也能在连续移动和转向过程中,保持出色的视角控制和画面稳定性。

依托实时可交互的音视频世界生成能力,JoyAI-Echo WM可应用于游戏、数字人直播、具身智能训练等场景:让游戏世界随玩家操作持续变化,让互动剧情拥有更强的参与感,让数字人在直播中能够保持角色、动作与声音连贯,也为未来具身智能体在虚拟环境中的探索、交互与训练提供新的技术基础。

JoyAI-Echo 1.5发布

京东基础模型矩阵全面升级

JoyAI-Echo WM的推出是JoyAI-Echo能力的延伸。今年6月,京东开源JoyAI-Echo长音视频生成框架,重点解决长视频中人物容易“变脸”、声音难保持一致、生成效率低等问题,让AI能够持续生成分钟级音视频内容。

此次升级至JoyAI-Echo 1.5版本,京东同步开源其中的Echo WM与长视频版本Echo-LongVideo。Echo-LongVideo支持约10分钟多镜头音视频生成,即使经过频繁转场、场景变化和新角色加入,仍能保持人物外观、声音与故事线索连贯;同步开放的Echo Director Agent还可完成故事展开、分镜规划、生成审核和成片组装。

JDD期间,京东JoyAI基础模型矩阵全面升级。目前,京东已形成覆盖语音、图像、视频、实时交互、世界建模与具身智能等方向的基础模型能力,推动AI 从数字世界迈向物理世界,全面赋能零售、物流、工业、健康等核心业务,助力京东建设全球最大物理世界运营中心。

编辑:gloria
    热门新闻
      24小时热榜
      日榜|周榜
          大众证券报
          微信扫码查看与分享