支持耳语与情绪控制!Fish Audio 周年重磅发布 S2.1Pro 实时对话语音模型

Fish Audio 在周年庆发布了生产级实时对话语音模型 S2.1Pro,首帧延迟低至 90 毫秒,支持通过文字指令控制耳语、紧张笑声等情绪,并可用 10–30 秒音频完成高质量语音克隆。这标志着语音 AI 正从“读稿式”TTS 转向真正可商用的实时交互对话。

一句话看懂:Fish Audio 在周年庆发布了生产级实时对话语音模型 S2.1Pro,首帧延迟低至 90 毫秒,支持通过文字指令控制耳语、紧张笑声等情绪,并可用 10–30 秒音频完成高质量语音克隆。这标志着语音 AI 正从“读稿式”TTS 转向真正可商用的实时交互对话。

事件核心:发生了什么

2026 年 7 月 29 日,AI 语音公司 Fish Audio 在成立周年之际正式推出其最新语音大模型 S2.1Pro。该模型并非为录播或旁白场景设计的传统 TTS,而是专门针对实时对话场景优化。据官方公布,S2.1Pro 的首帧音频播放延迟约为 90 毫秒,可自然支持对话轮换;同时原生支持 83 种语言,采用统一语音识别架构。在语音控制方面,S2.1Pro 不再依赖预置情感菜单,用户可以直接在文本中嵌入方括号标签,实现耳语、紧张笑声等细粒度情感指令。此外,模型支持多说话人对话生成,并能在 10–30 秒的参考音频样本上完成高质量语音克隆,无需额外微调。目前该模型已通过 Fish Audio API 提供,并设有免费额度供开发测试。

为什么重要

语音交互产品长期面临两大瓶颈:对话延迟和情感自然度。S2.1Pro 将首帧延迟压缩到 90 毫秒(接近人耳可感知的实时极限),并首次将零样本情绪控制融入文本标记,这直接降低了开发者在对话系统中集成自然语音的门槛。对行业而言,这意味着语音 AI 从“广播式”合成向“对话式”交互的转型开始有可落地的生产级基础设施。Fish Audio 在这一节点推出 S2.1Pro,既是对自身 TTS 能力的技术跃迁,也是对 Google、OpenAI 等巨头语音产品的一种差异化竞争——以更低的成本(无需大量微调数据)和更灵活的情感控制,切入了实时对话这个尚未被充分满足的长尾市场。

对用户/开发者/创作者的影响

对开发者:过去要实现对话中自然的情绪变化,通常需要复杂的情绪分类模型或大量标注数据。S2.1Pro 的“方括号标签”方案大幅降低了集成复杂度,开发者只需在文本中插入 [耳语][紧张笑声] 即可触发对应语气,非常适合虚拟助手、客服机器人、教育对话等场景。90 毫秒延迟也使得实时打断和轮换成为可能。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对内容创作者:多角色对话生成和 10–30 秒的快速语音克隆,让播客、有声书或虚拟角色配音的创作效率显著提升。创作者可利用该模型快速生成带情绪的对话音频,无需为每个角色单独训练声音。

对企业:产品可通过 API 直接将语音交互能力嵌入现有应用,免费额度降低了前期试错成本。同时,支持 83 种语言意味着出海产品能一次性覆盖多市场,不必为每种语言重复建设语音引擎。

值得关注的后续

第一,S2.1Pro 实际延迟在不同网络环境下的稳定性有待测试,官方公布的 90 毫秒是实验室数据还是生产环境平均值,需要更多第三方验证。第二,情绪控制标签是否支持复杂、连续的情绪变化(如从平静逐渐转为愤怒),目前仅透露了耳语、紧张笑声等示例,后续可观察文档更新的细粒度指令范围。第三,Fish Audio 的定价策略是否会对其他 TTS API(如 Azure、ElevenLabs)产生价格压力,以及是否开放本地部署或开源部分模型,值得关注。

来源:AIbase

celebrityanime
celebrityanime
文章: 15732

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注