
一句话看懂:NVIDIA 发布了一款名为 Audex(全称 Nemotron-Labs-Audex-30B-A3B)的新型音频-文本统一大语言模型,核心创新在于它能处理音频输入,但保持了其骨干文本模型(Nemotron-30B 架构)的推理能力,避免了传统多模态模型在迁移到音频任务时常见的“文本性能损失”。
事件核心:发生了什么
根据 MarkTechPost Research 报道,NVIDIA 正式发布了 Audex 模型。这是一个拥有 30B 参数(但推理时通过 MoE 架构激活 3B 参数)的音频-文本联合模型。与许多直接将音频编码器接入文本 LLM 的做法不同,Audex 的设计目标是:在融合音频理解能力后,模型在纯文本任务(如代码生成、数学推理、逻辑问答)上的表现应与其骨干文本模型持平甚至更优。这意味着 NVIDIA 解决了多模态训练中一个长期存在的难题——“灾难性遗忘”在音频模态的体现。
为什么重要
这一发布对 AI 行业具有多重意义。首先,它提供了“保留文本智能”的示范路径:以往语音助手或音频 AI 在加入音频能力后,往往在编码、推理等纯文本任务上智力退化。Audex 表明可以做到“增加能力而不牺牲原有优势”。其次,30B 总参数/3B 激活参数的设计(A3B 后缀代表激活参数规模),揭示了 NVIDIA 对高效推理的持续投入,这使得大型模型在终端或边缘设备上部署成为可能。最后,作为 Nemotron 家族的一员,它强化了 NVIDIA 从底层硬件(GPU)到上层模型生态(Nemotron)的闭环战略,有望推动音频 AI 在客服、会议转录、智能教育等场景的商业化落地。
对用户/开发者/创作者的影响
对于开发者而言,Audex 提供了一个新的融合模型选择:如果原本使用 Nemotron-30B 做文本推理,现在可以无缝添加音频输入接口,而无需调整推理逻辑或担心模型性能下降。对于内容创作者和音频工作者,这类模型能直接接受语音指令进行文本生成、代码编写或数据分析,交互体验更自然。对于企业采购 AI 服务的决策者,Audex 的低激活参数意味着推理成本可能低于同类型 30B 模型,尤其在云端部署时可以降低算力开销。不过,目前公开信息显示,该模型的 API 服务价格、开源计划以及具体的评测对比数据尚未完全披露。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,Audex 是否会在 NVIDIA 的 NGC 目录或 API 平台(如 NIM)中提供,这将直接影响开发者采用率。第二,竞品如 OpenAI 的 GPT-4o 及 Google Gemini 也有类似的多模态能力,Audex 在音频任务(如语音转意图、情感识别等)上的具体基准测试成绩,将是判断其竞争力的关键。第三,关注其开源状态:若作为开源模型发布,将极大地推动社区在嵌入式音频设备、边缘 AI 场景中的创新应用。


