​科大讯飞正式发布 Spark-ASR-2.0,全面赋能硬件与开放生态

科大讯飞于 2026 年 9 月 23 日正式发布新一代语音识别大模型 Spark-ASR-2.0,次日开始陆续接入讯飞输入法,并通过讯飞开放平台向开发者和企业客户开放 API。这次升级的重点不只是模型本身,而是把语音识别能力同步铺到硬件与开放生态两条线上。

一句话看懂:科大讯飞于 2026 年 9 月 23 日正式发布新一代语音识别大模型 Spark-ASR-2.0,次日开始陆续接入讯飞输入法,并通过讯飞开放平台向开发者和企业客户开放 API。这次升级的重点不只是模型本身,而是把语音识别能力同步铺到硬件与开放生态两条线上。

事件核心:发生了什么

根据 AIbase 报道,科大讯飞在 9 月 23 日推出新一代语音识别大模型 Spark-ASR-2.0。落地节奏上,该模型自 9 月 24 日起在讯飞输入法中逐步上线;同时,开发者和企业客户可通过讯飞开放平台调用其 API 服务。除输入法外,Spark-ASR-2.0 还将集成进讯飞 AI 眼镜、讯飞智能办公本、讯飞会议等核心软硬件产品,覆盖从个人输入到会议记录、办公协作等多类语音场景。

为什么重要

语音识别是大模型落地最成熟的方向之一,但竞争焦点正在从“识别准不准”转向“在什么设备、什么场景、以什么成本稳定可用”。科大讯飞选择在同一时间点推进输入法、硬件和 API 三条线,说明它把 ASR 视为贯穿消费端与企业端的基础能力,而非单一功能。对行业而言,这既是语音大模型推理能力的一次迭代,也是对“模型 + 硬件 + 开放平台”这一商业化路径的加固。国内语音赛道长期由讯飞、阿里、字节等厂商分食,Spark-ASR-2.0 能否在嘈杂环境、方言口音、长时段会议等场景拉开差距,将直接影响其在办公硬件和政企市场的议价能力。目前公开信息显示,官方尚未披露该模型的参数量、训练数据规模及具体评测指标。

对用户/开发者/创作者的影响

普通用户最直接的感受来自讯飞输入法:如果识别准确率和响应速度确有提升,日常语音输入、长句转写的体验会更好。使用讯飞 AI 眼镜、智能办公本和讯飞会议的用户,则可能获得更一致的跨设备语音体验。对开发者而言,API 通过讯飞开放平台开放,意味着可以在自有 AI 应用中接入语音识别能力,用于会议转写、客服质检、字幕生成等场景,但实际接入成本、并发限制和计费方式仍需以平台文档为准。对内容创作者来说,语音转文字效率的提升会直接影响采访整理、口播稿和短视频字幕的生产流程。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是输入法和硬件的实际推送进度,以及用户对识别效果的真实反馈;二是讯飞开放平台上 Spark-ASR-2.0 的 API 定价、免费额度和限流策略是否变化;三是竞品是否在短期内跟进发布同类语音大模型,尤其是在会议和办公硬件场景的正面竞争。

来源:AIbase

celebrityanime
celebrityanime
文章: 25192

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注