京东在 JDD 上甩出可交互视听世界模型:EchoWM 开源,长视频生成同步冲到 10 分钟以上

京东探索研究院在 9 月 9 日的 JDD 大会上发布了两项 JoyAI-Echo 系列新成果:JoyAI-Echo1.5 把连续音视频生成拉到 10 分钟以上,并开源了可交互视听世界模型 EchoWM。前者解决"生成得久",后者解决"能走进去、能操控",这也是世界模型从演示走向可用的一步。

一句话看懂:京东探索研究院在 9 月 9 日的 JDD 大会上发布了两项 JoyAI-Echo 系列新成果:JoyAI-Echo1.5 把连续音视频生成拉到 10 分钟以上,并开源了可交互视听世界模型 EchoWM。前者解决”生成得久”,后者解决”能走进去、能操控”,这也是世界模型从演示走向可用的一步。

事件核心:发生了什么

在京东全球科技探索者大会(JDD)上,京东探索研究院公布了 JoyAI-Echo 系列的两项进展。JoyAI-Echo1.5 是长视频生成模型的升级版,采用音视频 Memory Bank 架构,在多镜头、长时间生成中维持人物形象、声音和故事线的一致,支持 10 分钟以上的连续音视频产出。据公开信息,该模型通过长视频训练将推理速度提升至多 7.5 倍,480P 分辨率下用 2 张 H200 即可达到 24 帧每秒的实时 1:1 生成;配套的 Director Agent 可用自然语言走完故事开发、分镜规划、生成审核到最终合成的流程。

另一项是全新开源的可交互视听世界模型 EchoWM。它把”按用户动作持续生成画面”和”音视频联合生成”两条路线合并,输出包含 720P 视频、环境音、音乐和语音的原生音视频内容,声音会随场景、镜头和主体运动同步变化。通过统一的”镜头意图”,EchoWM 支持第一人称导航、第三人称相机与主体协同控制,以及多轮连续探索。在 WBench Navigation 评测的 158 个多轮导航案例中,EchoWM 及其四步因果流式版本 EchoWM-Flash 位列前两名,EchoWM 综合排名第一。

为什么重要

当前世界模型大致分两派:一派能响应用户操作但缺少自然声音,另一派能联合生成音视频却难以让用户持续修改。EchoWM 的价值在于尝试把可控性和原生音视频合到一套系统里,这直接影响 AI 生成内容能否从”可看”变成”可进入、可探索”。长视频侧,10 分钟连续生成和实时推理是商业化的两个硬门槛——时长决定内容形态(短剧、广告片),推理成本决定能否规模化。京东同时秀出 JoyAI 基础模型矩阵,覆盖图像视频生成、多模态理解、实时交互、世界建模、智能语音和具身操作,并预告 10 月正式发布音视频基础模型 JoyAI-Video,方向是电商广告、短剧创作和具身智能训练,路线指向清晰:把生成能力接到自身电商与内容场景里。

对用户/开发者/创作者的影响

对创作者,Long Video 加 Director Agent 的组合意味着多镜头短剧、广告片的生产流程可能被压缩,角色一致性和声音连续性这两大痛点有了工程化答案。对开发者,EchoWM 已开源,可交互世界模型加多轮导航能力适合做游戏原型、虚拟场景漫游、具身智能的仿真数据生成;配套的 JoyAI-Sim 仿真转换工具链和 EgoLive 真实世界数据,构成从数据到模型的支撑体系。对企业采购方,能否用少量 H200 实时出片,会直接影响单位内容成本,值得在试用中重点验证。目前公开信息显示,JoyAI-Video 计划 10 月发布,具体 API 与定价尚未披露。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 EchoWM 开源后的社区采用情况,包括推理门槛、显存需求和二次开发活跃度;二是 JoyAI-Echo1.5 的 10 分钟生成在真实创作流程中的稳定性,尤其是长程一致性能否维持;三是 10 月 JoyAI-Video 发布时,京东是否给出面向电商和短剧的具体工具或 API,以及它与可灵、即梦等国内视频生成产品的差异化定位。

来源:AIbase

celebrityanime
celebrityanime
文章: 23324

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注