NVIDIA 发布 Nemotron-Labs-Audex-30B-A3B 统一音频智能模型

随着多模态大模型的快速发展,音频处理能力往往受到妥协——许多模型在提升音频理解能力的同时,却牺牲了文本逻辑。为解决这一问题,NVIDIA 研究人员推出了 Nemotron-Labs-Audex-30B-A3B(Audex),这是一款统一的音频-文本大语言模型,旨在弥合这一差距。
Audex 采用精简高效的设计,基于强大的纯文本混合专家(MoE)架构构建。通过利用单个 Transformer 解码器,它同时处理文本和量化音频令牌。该方法将音频输入投影到文本嵌入空间,确保与现有用于多模态任务的大语言模型基础设施无缝集成,从而实现真正的深度融合。
训练过程涉及包含 1574 亿音频令牌和 3205 亿文本令牌的大量数据集。通过多阶段监督训练、纯文本级联强化学习以及多领域策略内知识蒸馏,Audex 在音频理解、语音识别、翻译和生成方面实现了行业领先的性能。关键在于,它以极小的性能损耗保留了原始大语言模型在推理、对齐、知识检索和长文本处理方面的核心能力。
作为开源模型,Audex 标志着语音技术领域的一个重要里程碑。超越理论研究,它为开发者提供了成熟的解决方案,可直接进行评估和部署。对于那些管理复杂音频交互的用户而言,Audex 提供了一个平衡的选项,在提升性能的同时,也为多模态智能研究开辟了新的途径。
相关文章
Fireworks AI 发布搭载 Opus 的 FireRouter:编码成本降低 57%,精度损失极小
Fireworks AI 推出了搭载 Opus 的 FireRouter,这是业界首个专为 Claude Opus 系列定制的缓存感知路由系统。目前,该独立路由模型已通过无服务器端点开放使用。经过超过一个月的内部 A/B 测试,FireRouter 在编码任务中实现了 98.1% 的准确率,同时与单独使用 Opus 相比,成本降低了 57%。FireRouter 的工作原理是在每次用户交互时评估每个模型对当前任务的适用性。它计算处理成本(包括提示词缓存),并判断切换模型所节省的成本是否足以抵消缓
如何修复移动 SEO 的核心网页指标
提升本地 SEO:构建您的 Google 实体云盘堆栈目录:简介理解 Google 实体云堆叠Google 实体云堆叠的关键优势开始使用 Google 实体云堆栈 4.1. 选项 1:获取老号 Gmail 账户 4.2. 选项 2:创建新账户配置 Google Drive 以进行实体堆栈 5.1. 了解文件夹类型 5.2. 创建公共文件夹 5.3. 跨账户共享文件夹最大化实体云堆栈的影响 6.1. 开发 SEO 友好型内容 6.2. 为您的堆栈生成反向链接管理和组织实体云堆栈的最
Moonshot AI 的 Kimi 完成超过 35 亿美元 F 轮融资,估值达 350 亿美元
据《科技日报》报道,月之暗面(Moonshot AI)旗下 Kimi 已成功完成 F 轮融资,融资金额超过 35 亿美元,投后估值达到 350 亿美元。得益于订阅需求超过目标三倍以上的强劲驱动,本轮融资提前完成。此外,此前计划中的 G 轮(Pre-IPO)融资也已加速推进,投前估值现已达 500 亿美元。作为中国领先的 AI 大模型公司,月之暗面凭借 Kimi 在长上下文处理及实际性能方面的突破,迅速获得了用户关注和市场认可。这笔巨额融资彰显了资本市场对国内前沿 AI 模型的强烈信心,为扩大
相关专题推荐
评论 (0)
0/500

随着多模态大模型的快速发展,音频处理能力往往受到妥协——许多模型在提升音频理解能力的同时,却牺牲了文本逻辑。为解决这一问题,NVIDIA 研究人员推出了 Nemotron-Labs-Audex-30B-A3B(Audex),这是一款统一的音频-文本大语言模型,旨在弥合这一差距。
Audex 采用精简高效的设计,基于强大的纯文本混合专家(MoE)架构构建。通过利用单个 Transformer 解码器,它同时处理文本和量化音频令牌。该方法将音频输入投影到文本嵌入空间,确保与现有用于多模态任务的大语言模型基础设施无缝集成,从而实现真正的深度融合。
训练过程涉及包含 1574 亿音频令牌和 3205 亿文本令牌的大量数据集。通过多阶段监督训练、纯文本级联强化学习以及多领域策略内知识蒸馏,Audex 在音频理解、语音识别、翻译和生成方面实现了行业领先的性能。关键在于,它以极小的性能损耗保留了原始大语言模型在推理、对齐、知识检索和长文本处理方面的核心能力。
作为开源模型,Audex 标志着语音技术领域的一个重要里程碑。超越理论研究,它为开发者提供了成熟的解决方案,可直接进行评估和部署。对于那些管理复杂音频交互的用户而言,Audex 提供了一个平衡的选项,在提升性能的同时,也为多模态智能研究开辟了新的途径。
Fireworks AI 发布搭载 Opus 的 FireRouter:编码成本降低 57%,精度损失极小
Fireworks AI 推出了搭载 Opus 的 FireRouter,这是业界首个专为 Claude Opus 系列定制的缓存感知路由系统。目前,该独立路由模型已通过无服务器端点开放使用。经过超过一个月的内部 A/B 测试,FireRouter 在编码任务中实现了 98.1% 的准确率,同时与单独使用 Opus 相比,成本降低了 57%。FireRouter 的工作原理是在每次用户交互时评估每个模型对当前任务的适用性。它计算处理成本(包括提示词缓存),并判断切换模型所节省的成本是否足以抵消缓
如何修复移动 SEO 的核心网页指标
提升本地 SEO:构建您的 Google 实体云盘堆栈目录:简介理解 Google 实体云堆叠Google 实体云堆叠的关键优势开始使用 Google 实体云堆栈 4.1. 选项 1:获取老号 Gmail 账户 4.2. 选项 2:创建新账户配置 Google Drive 以进行实体堆栈 5.1. 了解文件夹类型 5.2. 创建公共文件夹 5.3. 跨账户共享文件夹最大化实体云堆栈的影响 6.1. 开发 SEO 友好型内容 6.2. 为您的堆栈生成反向链接管理和组织实体云堆栈的最
Moonshot AI 的 Kimi 完成超过 35 亿美元 F 轮融资,估值达 350 亿美元
据《科技日报》报道,月之暗面(Moonshot AI)旗下 Kimi 已成功完成 F 轮融资,融资金额超过 35 亿美元,投后估值达到 350 亿美元。得益于订阅需求超过目标三倍以上的强劲驱动,本轮融资提前完成。此外,此前计划中的 G 轮(Pre-IPO)融资也已加速推进,投前估值现已达 500 亿美元。作为中国领先的 AI 大模型公司,月之暗面凭借 Kimi 在长上下文处理及实际性能方面的突破,迅速获得了用户关注和市场认可。这笔巨额融资彰显了资本市场对国内前沿 AI 模型的强烈信心,为扩大





首页






