英伟达发布 Audex 统一模型:30B 总参数,避免多模态扩展后文本能力下滑问题

英伟达于今年 6 月推出 Audex 统一音频-文本大模型,总参数 30B 但激活参数仅 3B,能在不牺牲文本推理能力的前提下,实现音频和语音的理解与生成,解决了多模态模型常遇到的“学新忘旧”难题。

英伟达发布 Audex 统一模型:30B 总参数,避免多模态扩展后文本能力下滑问题

一句话看懂:英伟达于今年 6 月推出 Audex 统一音频-文本大模型,总参数 30B 但激活参数仅 3B,能在不牺牲文本推理能力的前提下,实现音频和语音的理解与生成,解决了多模态模型常遇到的“学新忘旧”难题。

事件核心:发生了什么

英伟达在 2026 年 6 月发表的论文中公布了 Audex(全称 Nemotron-Labs-Audex-30B-A3B)模型,这是一个统一音频与文本的多模态大语言模型。其骨干为 Nemotron-Cascade-2-30B-A3B,采用 52 层混合 Mamba-Transformer 架构,配备 128 个可路由专家,每次推理激活 6 个专家。总参数量达 30B,但激活参数仅 3B,兼顾效率与容量。

在音频处理上,Audex 使用 AF-Whisper 作为音频编码器处理 16kHz 输入,通过两层 MLP 适配器映射特征,输出词表从原始的 131072 个 Token 扩展至 205312 个。语音输出采用 X-Codec2 编解码器,速率为每秒 50 个 token;非语音音频则使用 X-Codec,速率为每秒 200 个 token。

文本能力方面,Audex 在 MMLU-Redux 上得分为 86.4,高于骨干模型的 86.3;在 IMO AnswerBench 上为 81.1,高于骨干的 79.3;但在 MMLU-Pro 与 GPQA-Diamond 上出现小幅下降——这组数据表明,模型成功避免了多模态扩展导致文本能力严重退化的问题。

为什么重要

当前多数多模态模型在融合音频、图像等新能力时,往往会导致原有文本推理能力下降,这也被称为“灾难性遗忘”。Audex 的设计思路直接针对这一痛点,通过将音频输入编码后映射到文本嵌入空间,并把量化后的音频输出标记与文本标记统一处理,实现了多模态能力扩展与文本智能的平衡。对于大模型行业而言,这提供了一条可行的技术路径:在不对核心语言模型做大手术的前提下,安全嫁接新模态能力。

同时,30B 总参数、3B 激活参数的设计,意味着模型在推理时计算成本较低,有利于部署到端侧或生产环境。英伟达作为算力和模型领域的双重玩家,发布这样一个兼具效率和能力平衡的模型,也可能影响企业对多模态模型选型的判断。

对用户/开发者/创作者的影响

对于开发者和 AI 应用厂商,Audex 的发布意味着可以更直接地使用一个模型处理语音指令、音频内容分析和文本生成任务,而无需像以往那样拼接多个专用模型。例如语音助手、客服系统、音频摘要、语音翻译等场景,可能因此降低开发复杂度和算力成本。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对于内容创作者,如果 Audex 落地为产品,将有望实现更自然的语音交互体验,例如音频内容中语音识别后直接生成结构化文本、语音命令无需唤醒词即可理解上下文等。但目前公开信息显示,Audex 尚处于论文发布阶段,是否开放 API 或开源尚无明确安排。

值得关注的后续

第一,Audex 是否会以 API 形式在英伟达的 NIM(NVIDIA Inference Microservices)平台上架,以及定价策略如何,将直接影响开发者的采用率。第二,其他大模型厂商是否会跟进“统一词表+保持文本能力”的技术路线,形成新的多模态模型设计范式。第三,Audex 在非语音音频(如环境声音、音乐)上的表现尚未看到详细基准,如果该方向表现优异,可能开辟工业检测、音视频内容审核等新应用场景。

来源:Readhub · AI

celebrityanime
celebrityanime
文章: 14763

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注