Qwen3.8-Omni-Flash 定价低于 Google Gemini Flash,多模态基准表现却与之持平

阿里 Qwen 发布首款面向 AI Agent 的多模态模型 Qwen3.8-Omni-Flash,能同时处理音视频并自主调用工具,在多模态基准上追平 Google Gemini 3.8 Flash,但 API 价格只有后者的五分之一左右。

一句话看懂:阿里 Qwen 发布首款面向 AI Agent 的多模态模型 Qwen3.8-Omni-Flash,能同时处理音视频并自主调用工具,在多模态基准上追平 Google Gemini 3.8 Flash,但 API 价格只有后者的五分之一左右。

事件核心:发生了什么

2026 年 9 月 19 日,Qwen 推出 Qwen3.8-Omni-Flash,官方称这是其首个为 AI Agent 打造的多模态模型。它可以同时理解音频与视频,自行推理并调用工具,完成剪辑 Vlog、翻译短视频、总结电影等任务,上下文窗口达到 100 万 token。在音视频任务上,Qwen 表示其表现接近 Gemini 3.8 Flash。

定价是主要看点:API 输入每百万 token 0.15 美元,输出 0.47 美元。音频输入估算每小时不到 0.01 美元;720p 带音频、每秒一帧的视频处理约 0.20 美元,不含响应费用。相比之下,Gemini 3.8 Flash 目前输入 0.75 美元、输出 3.75 美元,且优惠价将在 2027 年 1 月 1 日翻倍。模型已上线 Qwen Studio、Qwen Cloud 和 API,配套开源 Qwen-MM-Plugins 可为 Claude Code、Gemini CLI、Qwen Code 等 Agent 增加视频编辑、说话人识别、PDF 视频笔记等能力,Qwen-Live Harness 则支持摄像头与麦克风实时交互。

为什么重要

多模态能力长期是 Gemini 系列的强项,Qwen 这次用价格差直接切入同一竞争区间:把音视频理解与工具调用打包进一个低价 API,意味着多模态 Agent 的推理成本结构可能被重估。对闭源厂商来说,压力不只是基准分数,而是单位 token 性价比——当输入价格相差约 5 倍、输出相差约 8 倍,且 Gemini 优惠期结束后差距进一步拉大时,开发者会认真比价。同时,开源插件把能力延伸到竞品 CLI 生态里,是一种绕开模型入口、直接争夺 Agent 工作流的做法。

对用户/开发者/创作者的影响

开发者可以更低成本试验音视频 Agent,例如自动字幕、跨语言短视频翻译、长视频摘要和批量素材处理,按小时计的音频成本已接近可忽略。创作者若使用支持这些插件的编码 Agent,可在既有工作流里加入视频剪辑与笔记生成,而不必切换到新平台。企业采购则需注意:低价是否伴随限流、延迟或区域可用性差异,目前公开信息未完整披露,实际选型仍应做小规模验证。需要提醒的是,基准接近不等于真实任务全面持平,复杂推理、长视频一致性和工具调用稳定性仍需实测。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,看第三方复现结果,尤其是音视频基准与长上下文下的表现是否稳定;第二,Gemini 是否调整 Flash 定价或推出更便宜的档位,价格战会直接影响开发者的迁移决策;第三,Qwen-MM-Plugins 在 Claude Code、Gemini CLI 等外部生态里的实际采用度,将决定它能否从模型供应升级为 Agent 工作流的一环。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 24473

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注