该模型采用混合专家架构与单一解码器设计,在保持文本逻辑能力不衰退的前提下实现音频理解与生成,总参数量30B激活参数3B,于7月8日公开相关技术细节。
英伟达研究团队推出了名为Nemotron-Labs-Audex-30B-A3B的统一音频与文本大语言模型,旨在解决多模态扩展过程中常见的文本逻辑能力下降问题。该模型基于纯文本混合专家架构构建,通过单一Transformer解码器同时处理文本与量化后的音频标记,实现了两种模态数据在嵌入空间的无缝融合,并确保了与现有大语言模型基础设施的兼容性。
在训练与参数配置上,Audex采用了30B总参数和3B激活参数的设定,骨干网络源自Nemotron-Cascade-2-30B-A3B,该基础模型包含52层混合Mamba-Transformer结构及128个可路由专家。训练数据规模庞大,涵盖了1574亿音频标记和3205亿文本标记。技术实现方面,输入端使用AF-Whisper编码器处理16kHz音频信号,经两层MLP适配器映射后,将词表从13.1万个扩展至20.5万个;输出端针对语音采用X-Codec2编解码器,非语音音频则使用X-Codec编解码器,分别以不同的标记速率和量化策略生成结果。模型通过多阶段监督训练、纯文本级联强化学习及多域策略知识蒸馏完成优化。
性能评估数据显示,Audex在保留原始语言模型核心能力方面表现显著,其MMLU-Redux得分为86.4分,略高于骨干模型的86.3分;IMO AnswerBench得分为81.1分,优于骨干模型的79.3分。尽管在MMLU-Pro与GPQA-Diamond测试中出现小幅分数波动,但模型在音频理解、语音识别、跨语言翻译及音频生成任务上均达到行业领先水平。作为开源项目,Audex为开发者提供了可直接部署的工具,解决了多模态模型常见的性能偏科问题,有助于推动智能客服、实时翻译及内容生成等应用场景的技术落地与多模态智能体研究的实用化进程。