阿里发布 Qwen3.8-Omni-Flash:原生全模态、百万上下文,音频成本砍掉 98%

阿里 Qwen 团队发布原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频、视频四类输入和 100 万 token 上下文,官方称音频输入成本下降超 98%,并在多项音频理解测试上超过 Gemini3.8Flash。

一句话看懂:阿里 Qwen 团队发布原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频、视频四类输入和 100 万 token 上下文,官方称音频输入成本下降超 98%,并在多项音频理解测试上超过 Gemini3.8Flash。

事件核心:发生了什么

2026 年 9 月,阿里 Qwen 团队推出 Qwen3.8-Omni-Flash。它不再把语音识别和图像识别简单拼接,而是在模型层面原生处理不同模态信息,官方称在 29 项基准测试中平均比上一代 Qwen3.5-Omni-Plus 提升超过 25%。模型最大输入接近 99.2 万 token(思考模式约 98.4 万),最大输出 13.1 万 token,支持 113 种语言和方言的音频输入,以及立体声和 4 声道空间音频分析。

音频能力是这次的主战场。在 WildClawBench-MM 多模态工具调用测试中,Qwen 得 71.0 分,Gemini3.8Flash 为 58.9;SpotSoundBench 上为 67.2 对 39.7;MMAU 为 81.8 对 76.9。多人会议识别提升更明显:AliMeeting 测试中说话人错误率(DER)从上代 88.11 降至 3.35,带说话人归属的词错误率(cpWER)从 89.61 降至 17.18。但在 AgenticVBench 上,Gemini3.8Flash 以 45.0 领先 Qwen 的 36.8,部分视频理解测试 Gemini 仍有优势。

价格方面,阿里云国际区定价为每百万输入 token 0.15 美元、缓存输入 0.016 美元、输出 0.47 美元。官方称音频输入每小时成本下降超 98%,音视频组合输入下降超 93%。模型未直接开源,但开放了配套多模态插件 Qwen-MM-Plugins,并计划推出 Qwen-Live-Harness。

为什么重要

这次发布的重点不是“又多了一个模态”,而是成本曲线和 Agent 能力的结合。过去处理长会议、播客、直播回放,开发者往往要切片、抽帧、串联多个模型,链路长、成本高、误差累积。100 万 token 上下文加上大幅降价的音频输入,意味着可以把整段长音视频直接交给一个模型处理,再让它调用工具完成剪辑、摘要、字幕等任务。目前公开信息显示,Qwen 与 Gemini 在多模态上的竞争正从“谁更聪明”转向“谁更便宜、更能干活”。

对用户/开发者/创作者的影响

对开发者来说,阿里云百炼已在北京、新加坡、香港、东京、法兰克福、弗吉尼亚等区域上线该模型,支持函数调用、联网搜索和上下文缓存,适合做会议纪要、视频内容定位、自动字幕等 AI 应用。对内容创作者和企业来说,长音频和视频素材的自动分析成本若真如官方所述下降九成以上,播客转写、直播复盘、素材归档这类高频需求会更容易规模化。需要注意的是,模型本身闭源,可复用的是插件和开发工具,实际成本仍取决于调用量和区域定价。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 98% 的降价在实际调用中能否兑现,尤其是长音频和音视频混合场景;二是 Gemini 是否会在音频工具调用和会议识别上快速跟进;三是未开源模型加开放插件的路线,能否吸引足够多的开发者留在 Qwen 生态里。

来源:AIbase

celebrityanime
celebrityanime
文章: 24179

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注