NVIDIA Nemotron Labs提出Audex,一个基于Nemotron-Cascade-2-30B-A3B的统一音频文本MoE模型。它用单一Transformer解码器处理文本、输入音频表示与量化音频输出,训练数据包含157.4B音频token和320.5B文本token,并称在音频理解、语音识别翻译、文本转语音及音频生成等任务达到领先水平,同时基本保持文本推理与智能体能力。模型检查点已开放。
最近 24 小时暂无可用热度快照。