科大讯飞发布 Spark-Audio-1.0-Preview:全国产算力训练,覆盖 99 种语言、202 种方言

科大讯飞发布语音大模型 Spark-Audio-1.0-Preview,用全国产算力训练,支持 99 种语言和 202 种方言,并开放体验、API 后续上线。它的看点不只是语言覆盖广,而是把语音模型的能力从“转写准”推进到“听懂场景与情绪”。

一句话看懂:科大讯飞发布语音大模型 Spark-Audio-1.0-Preview,用全国产算力训练,支持 99 种语言和 202 种方言,并开放体验、API 后续上线。它的看点不只是语言覆盖广,而是把语音模型的能力从“转写准”推进到“听懂场景与情绪”。

事件核心:发生了什么

2026 年 9 月 16 日,科大讯飞推出 Spark-Audio-1.0-Preview,官方定位为大规模语音基础模型。输入侧同时支持文本和语音,输出侧为文本;能力覆盖语音转写、多语言翻译、方言识别,并进一步扩展到环境音识别、说话人识别、情绪分析和复杂音频问答。官方给出的覆盖面是 99 种语言、202 种方言。最受关注的标签是“全国产算力训练”,也就是说,训练环节基于国产计算资源完成,而非依赖海外算力供应链。

目前该模型已开放体验,API 计划晚些时候在讯飞开放平台上线。

为什么重要

语音模型此前的主战场是“听得清”,即把声波准确转成文字;Spark-Audio-1.0-Preview 想解决的是“听得懂”,包括识别谁在说、语气里的情绪,以及背景里有什么声音。这对客服质检、会议纪要、内容审核、无障碍工具等场景更接近可用状态。

更值得关注的是算力路线。全国产算力训练意味着模型从底层降低了供应链风险,在当前算力受限与合规要求趋严的背景下,这一选择对政企客户和需要本地化部署的行业更有吸引力。它同时也会影响国内大模型竞争的一个隐性维度:谁能用可控算力把训练和推理成本压下来。

对用户/开发者/创作者的影响

对开发者而言,关键信息是 API 即将上线讯飞开放平台。如果接口支持多语言、方言与情绪识别组合调用,可以省去拼接多个专用模型的工程成本,适合做会议转录、跨境客服、语音内容分析等 AI 应用。对企业采购方,全国产算力训练是合规与数据安全上的加分项,但仍需等待 API 定价、并发限制和私有化部署方案。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创作者,方言和情绪识别降低了字幕、配音审核、播客内容标签化的门槛。不过目前公开信息显示这只是 Preview 版本,实际准确率、延迟和长音频处理能力还需实测验证,不宜提前当作生产级工具。

值得关注的后续

一是 API 上线时间、计费方式和是否支持私有化部署;二是模型在噪声环境、混合方言和长音频上的真实表现;三是竞品是否跟进类似“全国产算力 + 语音基础模型”的组合,开发者生态是否因此扩大。

来源:AIbase

celebrityanime
celebrityanime
文章: 23812

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注