Modulate 融资 2500 万美元,出售能监听语音通话而不只是转录文本的 AI

波士顿音频 AI 公司 Modulate 完成 2500 万美元新融资,主打不看转写文本、直接分析原始语音信号的产品 Velma,可用于反诈、客服质检与检测 AI 语音代理是否按预期工作。它代表了一条与主流大模型不同的技术路线:语音不是先转成文字再理解。

一句话看懂:波士顿音频 AI 公司 Modulate 完成 2500 万美元新融资,主打不看转写文本、直接分析原始语音信号的产品 Velma,可用于反诈、客服质检与检测 AI 语音代理是否按预期工作。它代表了一条与主流大模型不同的技术路线:语音不是先转成文字再理解。

事件核心:发生了什么

Modulate 由 Mike Pappas 和 Carter Huffman 在 MIT 结识后创办,本轮 2500 万美元融资由 Future Ventures 领投,Hyperplane、Lakestar 参投,累计融资达 6000 万美元,Lakestar 曾在 2022 年领投其 3000 万美元 A 轮。公司最早因游戏语音审核出名,其 ToxMod 系统自 2023 年起用于《使命召唤》的语音聊天治理。

主产品 Velma 直接分析音频信号,识别情绪、语气、意图、重音以及语音是否为合成,再将多个信号组合判断欺诈、骚扰、客户不满等事件,并可在通话进行中实时输出结果。技术上它不依赖单个大模型,而是用“集成聆听模型”按任务调度 100 多个小型专用音频模型。目前公开信息显示,Modulate 自称该方式比单个大模型效率最高提升 1000 倍,且比通用大模型识别真实问题准确率高一倍、误报少七倍,这些对比数据来自公司自身;可核查的是,其转写模型 7 月在 Hugging Face Open ASR 排行榜 88 个条目中排名第一,深度伪造检测自 3 月起在 Speech Deepfake Arena 居首,等错误率 1.1%,批量转写价格为每小时 0.03 美元。

为什么重要

语音正在成为 AI 代理的主要交互界面,但很多风险藏在语调、停顿和声纹里,转写文本会丢失这些信息。Modulate 押注“音频原生”路径,并把能力做成可调用的 SDK、API 和合作集成,等于把音频理解变成可采购的基础能力,而不是每家公司自己训练模型。这既绕开了通用大模型在音频实时推理上的算力成本,也在反诈、客服、合规等场景形成差异化。Future Ventures 的 Steve Jurvetson 称其在音频原生 AI 上建立了明显技术领先。

对用户/开发者/创作者的影响

对开发者而言,若要做语音代理的质检、风控或情绪识别,未来可能不必自建音频大模型,通过 API 按小时计费即可获得判断能力;对企业和客服团队,这类工具能实时发现欺诈来电或客户不满,而不仅是事后看转写记录。对创作者,尤其做配音、播客和虚拟人内容的人,深度伪造检测能力也可能反向影响平台对合成语音的标注与审核要求。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 SDK 和 API 的定价与开放程度,是否会真降低语音产品的自研门槛;二是实时反诈、AI 语音代理质检等场景能否规模落地,以及医院等客户的实际效果;三是能力增强后,语音监控与隐私合规的边界如何被监管讨论。

来源:The Next Web

celebrityanime
celebrityanime
文章: 26087

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注