一句话看懂:阿里 Qwen 发布首款面向 AI Agent 的多模态模型 Qwen3.8-Omni-Flash,能同时处理音视频并自主调用工具,在多模态基准上追平 Google Gemini 3.8 Flash,但 API 价格只有后者的五分之一左右。
事件核心:发生了什么
2026 年 9 月 19 日,Qwen 推出 Qwen3.8-Omni-Flash,官方称这是其首个为 AI Agent 打造的多模态模型。它可以同时理解音频与视频,自行推理并调用工具,完成剪辑 Vlog、翻译短视频、总结电影等任务,上下文窗口达到 100 万 token。在音视频任务上,Qwen 表示其表现接近 Gemini 3.8 Flash。
定价是主要看点:API 输入每百万 token 0.15 美元,输出 0.47 美元。音频输入估算每小时不到 0.01 美元;720p 带音频、每秒一帧的视频处理约 0.20 美元,不含响应费用。相比之下,Gemini 3.8 Flash 目前输入 0.75 美元、输出 3.75 美元,且优惠价将在 2027 年 1 月 1 日翻倍。模型已上线 Qwen Studio、Qwen Cloud 和 API,配套开源 Qwen-MM-Plugins 可为 Claude Code、Gemini CLI、Qwen Code 等 Agent 增加视频编辑、说话人识别、PDF 视频笔记等能力,Qwen-Live Harness 则支持摄像头与麦克风实时交互。
为什么重要
多模态能力长期是 Gemini 系列的强项,Qwen 这次用价格差直接切入同一竞争区间:把音视频理解与工具调用打包进一个低价 API,意味着多模态 Agent 的推理成本结构可能被重估。对闭源厂商来说,压力不只是基准分数,而是单位 token 性价比——当输入价格相差约 5 倍、输出相差约 8 倍,且 Gemini 优惠期结束后差距进一步拉大时,开发者会认真比价。同时,开源插件把能力延伸到竞品 CLI 生态里,是一种绕开模型入口、直接争夺 Agent 工作流的做法。
对用户/开发者/创作者的影响
开发者可以更低成本试验音视频 Agent,例如自动字幕、跨语言短视频翻译、长视频摘要和批量素材处理,按小时计的音频成本已接近可忽略。创作者若使用支持这些插件的编码 Agent,可在既有工作流里加入视频剪辑与笔记生成,而不必切换到新平台。企业采购则需注意:低价是否伴随限流、延迟或区域可用性差异,目前公开信息未完整披露,实际选型仍应做小规模验证。需要提醒的是,基准接近不等于真实任务全面持平,复杂推理、长视频一致性和工具调用稳定性仍需实测。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,看第三方复现结果,尤其是音视频基准与长上下文下的表现是否稳定;第二,Gemini 是否调整 Flash 定价或推出更便宜的档位,价格战会直接影响开发者的迁移决策;第三,Qwen-MM-Plugins 在 Claude Code、Gemini CLI 等外部生态里的实际采用度,将决定它能否从模型供应升级为 Agent 工作流的一环。


