讯飞星火语音基座大模型上线:0.65B 编码器配 30B MoE,纯国产算力训练

科大讯飞发布星火语音基座大模型 Spark-Audio-1.0-Preview,用 0.65B 编码器加 30B-A3B MoE 大模型,基于纯国产算力集群训练,让机器从"听清"转向直接"听懂"声音里的语义、情绪与环境音。

一句话看懂:科大讯飞发布星火语音基座大模型 Spark-Audio-1.0-Preview,用 0.65B 编码器加 30B-A3B MoE 大模型,基于纯国产算力集群训练,让机器从”听清”转向直接”听懂”声音里的语义、情绪与环境音。

事件核心:发生了什么

讯飞此次上线的 Spark-Audio-1.0-Preview,是一款语音基座大模型。结构上,音频编码器为 0.65B 的 Dense 架构,语言模型部分为 30B-A3B 的 MoE 架构,训练数据包含 1300 万小时音频与大量文本,训练集群为纯国产算力。区别于传统”语音转文字再交给大模型”的级联方案,它让同一模型同时接受文本和音频两种模态,直接处理语音转写、多语种翻译、多方言识别、环境音识别、说话人识别、情感分析和复杂音频问答等任务。官方称其支持 99 种语言和 202 种方言。

为什么重要

级联方案有两个结构性问题:一是信息损耗,文字只记录”说了什么”,丢掉语气、情绪和背景音;二是模块串联造成误差累积和延迟。语音基座把这条链路收敛成一个模型,本质上是在改技术路线。更关键的是算力口径——全程基于国产集群训练,在当前算力受限的背景下,这条信息的象征意义不亚于模型本身。性能层面,官方称其在高噪声、小声说话等真实场景表现较好,多语种多方言任务上优于同量级模型,中英、多语种、多方言评测分数高于 Gemini-3.1 Pro,并在 Fleurs 中文测试集达到 SOTA。不过讯飞也承认,指令跟随、对话和音频理解仍有提升空间。

对用户/开发者/创作者的影响

对开发者来说,最实际的信息是 API 将后续在讯飞开放平台上线,且官方提到可按”1+N”思路对基座做微调,衍生语音识别、实时翻译、语音交互等专用模型,这意味着做会议记录、客服质检、字幕翻译、播客处理的团队有了一个新的基座选项,尤其适合需要方言或嘈杂环境识别的场景。对创作者,环境音与情感识别能力打开的是音频内容检索、自动剪辑标记这类用法,而非简单的转写。对企业采购,纯国产算力训练是合规与供应链层面的加分项,但目前仅为 Preview 版本,尚不适合直接作为生产环境依赖。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 API 上线时间与定价,这决定了它能否真正进入开发者工作流;二是正式版在指令跟随和音频理解上的改进幅度,这是与闭源模型拉开或缩小差距的关键;三是同量级开源与闭源语音模型是否跟进基座化路线,以及高噪声、方言场景的第三方实测结果是否与官方口径一致。

来源:AIbase

celebrityanime
celebrityanime
文章: 23832

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注