ByteDance 的 Seedance 2.5 可生成带内置音频的 30 秒视频片段。

字节跳动发布 AI 视频模型 Seedance 2.5,可在一次生成中同时输出视频和内置音频,单段最长 30 秒并支持多次续写。相比谷歌 Gemini Omni Flash 约 10 秒的生成上限,这是目前公开信息里少见的更长片段能力,也意味着 AI 视频制作正从“单段拼接”走向“整片生成”。

一句话看懂:字节跳动发布 AI 视频模型 Seedance 2.5,可在一次生成中同时输出视频和内置音频,单段最长 30 秒并支持多次续写。相比谷歌 Gemini Omni Flash 约 10 秒的生成上限,这是目前公开信息里少见的更长片段能力,也意味着 AI 视频制作正从“单段拼接”走向“整片生成”。

事件核心:发生了什么

字节跳动于 2026 年 8 月正式推出 Seedance 2.5,这是其 AI 视频模型的一次版本更新。核心变化在于:模型在单次推理中同时生成视频画面和对应音频,不再需要后期配音或音效合成。输出方面,Seedance 2.5 支持生成最长 30 秒的视频片段,并且可以多次扩展续写,形成更长的叙事序列——谷歌 Gemini Omni Flash 目前约为 10 秒。

在创作控制上,Seedance 2.5 允许用户上传最多 30 张图像、10 个视频片段和 10 个音频文件作为参考素材,用以构建包含多个角色和不同机位的场景。字节跳动同时宣称,模型在纹理、光影和皮肤细节上相比前代有进一步提升。

为展示能力,字节跳动放出了一部完全由 Seedance 2.5 生成的短片《The Missing Pair》。目前该模型已在即梦 AI(Jimeng AI)和豆包 Pro 中上线,API 访问将通过 BytePlus ModelArk 平台提供,具体开放时间尚未公布。

为什么重要

Seedance 2.5 的价值不在于单纯的参数提升,而在于它把“视频生成”和“音频生成”合并为一条端到端的生产链路。过去创作者通常需要分别用图像生成、视频生成、配音和音效工具完成不同环节,再在剪辑软件里拼合;Seedance 2.5 则试图让一个模型直接输出带声音的完整片段,这减少了工具链的断裂和素材对齐成本。对广告、影视预演等依赖快速出片的场景,这种“一条流水线”的模式可能改变团队原有的制作流程。

从竞争格局看,字节跳动以 30 秒的生成长度直接拉开与谷歌同类产品的差距,同时其前代模型 Seedance 2.0 已登顶 Artificial Analysis 的“带音频图像转视频”排行榜,说明字节在这一细分方向上保持了连续的迭代节奏。值得注意的是,《第九区》导演 Neill Blomkamp 曾使用 Seedance 2.0 制作了 13 分钟的 AI 短片《Nightborne》,新版本的长片段能力可能进一步吸引专业影视创作者尝试。

对用户/开发者/创作者的影响

对普通用户而言,即梦 AI 和豆包 Pro 已可直接体验 Seedance 2.5,无需等待 API 开放即可在应用内生成带声音的视频片段。对创作者来说,多图、多视频、多音频的混合参考输入降低了复杂场景的控制门槛——例如在一条广告里让同一角色在不同机位下保持形象一致,理论上不需要反复抽卡或手动修图。对开发者和企业用户,BytePlus ModelArk 上线后的 API 定价和并发能力才是关键变量:如果价格控制在可接受范围,电商、营销和短视频工具可以把“生成带音频视频”作为功能直接集成到产品中。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前有几个具体观察点值得跟踪:第一,Seedance 2.5 的 API 何时通过 BytePlus ModelArk 正式开放,以及定价相对前代和竞品是否有明显变化;第二,30 秒长片段在复杂场景下是否稳定——多角色一致性、音频与口型对齐、光影连续性都需要更多真实用例验证;第三,谷歌 Gemini Omni Flash 及其他竞品是否会因为这一代差而加速提升生成长度,带动整个行业重新定义“单次生成”的规格。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 16408

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注