阶跃星辰王炸发布 StepAudio 3 系列语音大模型,强势斩获多项全球第一!

阶跃星辰于9月15日发布 StepAudio 3 系列五款语音大模型,在 Artificial Analysis 的对话动态与语音推理榜单上拿下全球第一,并已全部上线开放平台。这意味着语音赛道的竞争,正从单点能力转向“识别、生成、实时交互、音频制作”一体化的产品矩阵。

一句话看懂:阶跃星辰于9月15日发布 StepAudio 3 系列五款语音大模型,在 Artificial Analysis 的对话动态与语音推理榜单上拿下全球第一,并已全部上线开放平台。这意味着语音赛道的竞争,正从单点能力转向“识别、生成、实时交互、音频制作”一体化的产品矩阵。

事件核心:发生了什么

阶跃星辰此次一次推出五款模型:StepAudio3Realtime(实时语音交互)、StepAudio3ASR(语音识别)、StepAudio3TTS(语音合成)、StepAudio3Gen(综合音频内容生成)、StepAudio3Music(音乐创作)。目前公开信息显示,其中 Realtime 在 Artificial Analysis 对话动态榜以 98.9% 综合得分排名第一,语音推理准确率 99.7% 同样居首;ASR 的非流式字错率(WER)为 1.7%,并列全球第一。五款模型均已上线阶跃星辰开放平台,覆盖拟真语音、音频内容生成、实时交互、复杂场景理解和音乐创作五类场景。

为什么重要

语音大模型的竞争此前多集中在转写准确率或音色拟真度等单点指标上,而这次发布把“能听、能说、能推理、能制作”打包成一套可调用的模型组合,指向的是更完整的语音交互基础设施。Realtime 强调全双工、可处理打断与连续反馈,并把推理与语音生成并行、工具调用异步执行,这类工程能力直接决定了语音 Agent 在真实场景中是否可用。若榜单数据能转化为稳定体验,受影响的不只是语音工具创业公司,也包括正在为大模型寻找语音入口的云厂商和硬件厂商。

对用户/开发者/创作者的影响

开发者可以在阶跃星辰开放平台按场景选择模型,用 API 接入实时对话、长音频转写或音频生成能力,而不必自行拼装多套模型;医疗、法律、金融、汽车等专业领域的识别表现,是目前公开信息中值得验证的方向。创作者层面的变化更直接:StepAudio3Gen 支持用自然语言加参考音频一次性生成人声、音效、环境音与背景音乐,StepAudio3Music 则支持基于 ABC 记谱的多轮创作,甚至能为一轨清唱自动补齐和声与编曲,音频制作的门槛和流程长度都可能被压缩。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是榜单第一能否在真实并发和长任务场景下复现,尤其是全双工交互的延迟与打断处理;二是五款模型的 API 定价与调用限制,这会决定中小团队是否用得起;三是国内外语音模型的跟进节奏,以及音乐生成在版权与商用授权上的合规安排。

来源:AIbase

celebrityanime
celebrityanime
文章: 23551

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注