千问上线 Qwen3.8-Omni-Flash:1M 上下文,30项评测平均提升超26%

阿里千问于 9 月 18 日上线原生多模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频、视频输入与 1M 上下文。它在 30 项评测中平均分比上一代 Qwen3.5-Omni-Plus 提升超过 26%,同时把音视频 API 价格大幅压低。

一句话看懂:阿里千问于 9 月 18 日上线原生多模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频、视频输入与 1M 上下文。它在 30 项评测中平均分比上一代 Qwen3.5-Omni-Plus 提升超过 26%,同时把音视频 API 价格大幅压低。

事件核心:发生了什么

Qwen3.8-Omni-Flash 已可在 Qwen AI 平台体验。此前的 Qwen 系列已在编程、文本知识工作和 GUI 操作上积累 Agentic 能力,这次升级的重点转向音视频场景,覆盖视频剪辑、MV 制作、影视解说、音视频转文字摘要以及音视频对话等工作流。

官方公布的评测数据包括:音视频 Agent、编程和长任务方向上,WildClawBench-MM 提升 36.5 分,AgenticVBench 提升 22.3 分,UniClawBench 达到 69.6 分;基础能力方面,LongAudioSpan 提升 8.3 分,OmniVideoBench 提升 9.6 分,OmniCap-IF 的 CSR/ISR 分别提升 8.5 和 14.1 分。AliMeeting 的 DER/cpWER 从 88.11/89.61 降至 3.35/17.18。官方称其音视频能力接近 Gemini3.8Flash,整体音频能力超过对方。价格上,API 音频输入每小时的费用下降超过 98%,音视频输入下降超过 93%。

为什么重要

多模态模型的竞争正从“能不能听懂看懂”转向“能不能长时间稳定处理并调用工具”。1M 上下文加上 Agentic 方向,说明千问想把模型放进真实的生产流程,而不只是做问答演示。官方同步开源 Qwen-Live Harness、扩展 Qwen-MM-Plugins,是在补工具链和运行环境,这对开发者生态的吸引力不小。价格下降超过九成,也会直接影响音视频类 AI 应用的调用成本结构。

对用户/开发者/创作者的影响

对创作者来说,视频剪辑、解说、音视频摘要这类工作可以尝试用单一模型串起来,减少在多个工具间切换。对开发者来说,音视频输入成本大幅下降,意味着批量转写、长视频理解和实时对话类应用更容易跑通商业模型;开源组件也给了自建流程的空间。企业采购方则需要关注:官方宣称的性能接近 Gemini3.8Flash,但实际稳定性、延迟和中文场景表现仍需自测。目前公开信息显示,Realtime 版本是首个支持“声音定位”的全模态大模型。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 API 实际计费与限流规则是否和宣传一致,音视频长任务的真实成本如何。二是开源组件 Qwen-Live Harness 和 Qwen-MM-Plugins 的社区采用速度,能否形成可复用的 Agent 工作流。三是 Gemini 等竞品是否跟进降价或推出对标的多模态 Agent 能力。

来源:AIbase

celebrityanime
celebrityanime
文章: 24155

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注