从生成内容到创造体验,多模态大模型如何改变内容生产?

阿里巴巴在云栖大会更新多模态生成模型家族,发布图像模型 Qwen-Image-3.1、音乐模型 Happy Shrimp 1.1 和智能体式创作引擎 Agentic PE,并预告新一代视频模型将于今年 11 月发布。核心变化是:生成模型正从"好看"走向生产可用。

一句话看懂:阿里巴巴在云栖大会更新多模态生成模型家族,发布图像模型 Qwen-Image-3.1、音乐模型 Happy Shrimp 1.1 和智能体式创作引擎 Agentic PE,并预告新一代视频模型将于今年 11 月发布。核心变化是:生成模型正从”好看”走向生产可用。

事件核心:发生了什么

导演陆川用阿里巴巴多模态模型制作短片《历史·现场》,复原 1626 年明代北京城”王恭厂之变”,原本需要数月、千万级投入的制作压缩到 5 天。支撑这类实践的是模型能力的持续提升。此次云栖大会,阿里巴巴发布图像生成模型 Qwen-Image-3.1、音乐生成模型 Happy Shrimp 1.1,以及面向长视频和复杂创作的 Agentic PE。新一代视频生成模型将于今年 11 月发布。阿里巴巴 ATH 技术副总裁郑波表示,视频模型已从 DiT 验证阶段走向多模态参考创作,正进入理解创作意图的阶段。

为什么重要

过去两年,图像和视频模型的画质提升明显,但进入生产场景后,创作者更需要稳定、可控的结果,而不是反复”抽卡”。Qwen-Image-3.1 提供点、线、面、体、场五个维度的编辑能力,对应像素锚定、结构勾勒、版面构建、角色塑造和世界营造。郑波认为,编辑能力一定程度体现了图像模型的推理能力。音乐方面,Happy Shrimp 1.1 引入音乐审美建模与强化学习,将旋律、律动、声部清晰度和音色自然度纳入奖励反馈,让”音乐性”本身成为优化目标。视频方面,阿里巴巴判断下一代模型将朝”更长、更可控、更完整、更智能”提升,Agentic PE 负责组织空间布局、运动轨迹、人物姿态、深度和相机几何等多模态控制条件。目前公开信息显示,三年内可能出现原生全模态统一模型。

对用户/开发者/创作者的影响

对普通用户,Happy Shrimp 支持从一句想法生成人声歌曲或纯音乐,歌词可自己写也可由 AI 辅助。对专业音乐人,模型支持多模态参考、局部编辑和多轮创作,例如保留 A 的旋律、用 B 的编曲风格与 C 的音色重新演绎,或只增强副歌鼓组冲击力而不改动其他段落。对影视和设计从业者,Qwen-Image-3.1 可用于科研图示、营销图片和电影分镜,减少反复生成的不确定性。开发者则可关注 Agentic PE 如何调用工具构建控制条件,以及多模态预训练与智能体配合在长视频和实时流式生成中的落地方式。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是新一代视频模型 11 月发布后,”更长、更可控、更完整、更智能”具体体现在哪些指标;二是 Agentic PE 是否开放为可调用的开发接口,以及算力与时延成本;三是图像和音乐模型在开源与闭源策略上的选择,是否会影响开发者生态和内容平台的采用节奏。

来源:InfoQ CN

celebrityanime
celebrityanime
文章: 24994

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注