一句话看懂:AI语音创业公司Fish Audio完成5000万美元种子轮融资,由Coreline Ventures和Capital Today领投。这家公司从开源项目起步,至今已积累800万用户和2100万美元年经常性收入,核心卖点是提供超过1.5万个自然语言控制参数的语音模型,兼顾创作者的表现力需求与企业客户的定制化需求。
事件核心:发生了什么
总部位于帕洛阿尔托的Fish Audio昨日宣布完成5000万美元种子轮融资,领投方为Coreline Ventures和Capital Today,359 Capital、Parable、Play Time等机构跟投。公司前身是前NVIDIA研究员Shijia Liao的个人开源项目,其开源模型Fish Speech在GitHub上已获超过3.1万星标,被独立开发者、游戏设计师和视频创作者广泛采用。
自去年正式成立以来,Fish Audio已发布五款模型——四款语音生成模型和一款语音转文字模型,其中三款语音生成模型开源,最新版S2.1 Pro仅通过付费API提供。公司目前支持超过1.5万个自然语言控制参数,付费套餐面向创作者和团队提供分钟数配额与声音克隆功能,企业客户则包括HeyGen、Sanas和Plaud等知名AI应用公司。
值得注意的是,Fish Audio的声音库部分来自用户主动提交的声音素材,并给予贡献者补偿。但数月前曾因创作者指控其未经同意上传声音而陷入争议。目前公司已实现自动化下架流程,创作者提交声音样本或合约后可在3分钟内完成下架。
为什么重要
这笔融资发生在AI语音市场竞争已相当拥挤的节点。ElevenLabs、WellSaid、Cartesia、Speechify等公司都在争夺创作者和企业预算。Fish Audio的差异化在于两点:一是开源策略降低了开发者门槛,其开源模型GitHub星标数在同类中位居前列,形成了强大的社区基础;二是精细化的控制能力——1.5万个参数让用户能对语调、情感、语速等进行细粒度调节,而不仅仅是“朗读文本”。这满足了两类截然不同的需求:创作者需要更自然的表达力,企业(如语音代理、客服自动化)需要可操控、低延迟的语音。
投资方359 Capital的合伙人Rico Mallozzi评价,Fish Audio能以相对小的团队达到接近人类自然声音的水平,体现了技术效率优势——这暗示其模型训练成本可能低于其它大型AI实验室,这对商业化可持续性至关重要。
对用户/开发者/创作者的影响
对于独立开发者与创作者:Fish Audio开源的前三代模型依然是免费可用资源,适合需要高自定义语音的独立游戏开发、视频配音、有声书制作等场景。其付费API则适合对延迟和效果有更高要求的专业团队,例如使用AI avatars、实时语音对话等。声音克隆功能目前需用户自行提交声音或验证所有权,避免了从前“先上传后投诉”的被动局面。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对于企业客户:Fish Audio提供的企业API平台已获HeyGen等公司采用,其低延迟、自然且可编程的语音模型很适合集成到数字人、智能客服、销售外呼等场景。企业可以通过控制参数调节语速、语气,甚至让AI在不同任务中切换风格。
对于行业内竞品:Fish Audio的开源生态形成了一定网络效应,如果官方持续维护并迭代开源版本,可能会吸引更多开发者长期依赖其模型,从而压缩闭源竞品的市场空间。但版权合规问题仍是其隐忧——尽管下架流程已自动化,但源头防范机制仍不完善,可能影响创作者信任。
值得关注的后续
1. 新产品落地节奏:Fish Audio计划今年推出音频理解模型和语音到语音模型,前者能理解音频内容(如情绪、场景),后者直接实现语音到语音的转换。市场将检验这些产品能否持续保持开源/闭源搭配策略,以及是否会冲击现有竞品如ElevenLabs的语音翻译功能。
2. 版权合规与信任建设:Coreline Ventures的合伙人明确表示“社区驱动的模式只有创作者信任平台才能成为持久优势”。后续Fish Audio是否推出声音验证签约、收入分成等机制,将直接影响高质量声音贡献者的留存,以及平台声誉修复速度。
3. 商业化与开源平衡:当前开源模型和三款语音生成模型免费,最新S2.1 Pro闭源。如果后续模型全部闭源,可能会削弱开发者社区的活跃度。另外,2100万美元年经常性收入能否支撑持续研发,以及本轮5000万美元将主要投向模型训练还是市场推广,将决定其未来一年的竞争态势。


