阶跃发布StepAudio3系列模型:五款模型同步上线开放平台

阶跃(StepZenith)一次性发布 StepAudio3 系列五款语音模型并上线开放平台,覆盖实时对话、语音识别、语音合成、通用音频生成和音乐创作,其中实时对话与识别两项指标在 Artificial Analysis 榜单并列或位居全球第一。

一句话看懂:阶跃(StepZenith)一次性发布 StepAudio3 系列五款语音模型并上线开放平台,覆盖实时对话、语音识别、语音合成、通用音频生成和音乐创作,其中实时对话与识别两项指标在 Artificial Analysis 榜单并列或位居全球第一。

事件核心:发生了什么

2026 年 9 月 15 日,阶跃正式推出 StepAudio3 系列,包含五款模型:StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 与 StepAudio3Music,均已在其开放平台提供。据官方信息,StepAudio3Realtime 支持原生全双工实时对话,可同时理解语义、语调、情绪、副语言与环境音,并支持并行推理与语音生成、Tool Call 以及长任务异步执行,在 Artificial Analysis 对话动态榜单综合得分 98.9%,语音推理准确率 99.7%,两项均列全球第一;StepAudio3ASR 将语音识别与大模型上下文理解结合,覆盖中英文、方言、中英混说、长音频及医疗、法律、金融等专业场景,WER 为 1.7%,并列全球第一。其余三款分别面向实时语音交互的精细韵律合成、角色音效环境音与背景音乐的统一生成,以及歌曲创作、清唱伴奏、翻唱和基于 ABC 记谱的多轮创作。

为什么重要

此前语音模型的竞争多集中在单一环节:识别拼 WER,合成拼音色,音乐生成拼片段质量。StepAudio3 的思路是把这些能力打包成一条从“听懂”到“实时交互”再到“音频内容生产”的链路,并用榜单数据做横向对标。这释放两个信号:一是语音赛道的评价标准正从单项指标转向端到端体验,尤其是全双工对话中的情绪和副语言理解;二是“完整音频生成”开始被当作一个统一能力来卖,而不是把音效、配乐、人声拆成不同工具。对仍在单点模型上竞争的厂商来说,这意味着需要补齐上下文理解和实时推理,而不只是提升音质。目前公开信息显示,五款模型均为闭源、以开放平台 API 形式提供,阶跃暂未提及开源计划。

对用户/开发者/创作者的影响

开发者最直接的变化是接入门槛降低:实时对话、ASR、TTS 可由同一平台统一调用,Tool Call 与异步长任务支持让语音 Agent 更容易嵌入客服、会议记录、车载助手等场景,省去多模型拼接的工程成本。创作者侧,StepAudio3Music 的自然语言控制风格、旋律、节奏、乐器与情绪,加上多轮创作和 ABC 记谱支持,适合做 demo 迭代和短视频配乐;StepAudio3Gen 的多角色与语音时序控制则对有声内容、播客和游戏音频更有用。企业采购需关注两点:一是实时全双工对延迟和算力的实际要求,二是医疗、法律、金融等专业场景下识别准确率能否在真实口音和噪声环境中稳定复现。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一,榜单分数能否在第三方实测中复现,尤其是 WER 1.7% 在方言与嘈杂环境下的表现;二,开放平台的定价与限流策略,将决定中小开发者能否低成本接入;三,竞品是否跟进“全双工实时 + 完整音频生成”的组合路线,以及阶跃是否会把部分模型开源以扩大生态。

来源:AIbase

celebrityanime
celebrityanime
文章: 23551

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注