Hogar
NVIDIA presenta el modelo de inteligencia de audio unificado Nemotron-Labs-Audex-30B-A3B

A medida que los modelos grandes multimodales evolucionan rápidamente, las capacidades de procesamiento de audio se ven frecuentemente comprometidas; muchos modelos mejoran la comprensión del audio a expensas de la lógica textual. Para abordar esto, los investigadores de NVIDIA han presentado Nemotron-Labs-Audex-30B-A3B (Audex), un modelo de lenguaje grande unificado de audio-texto diseñado para cerrar esta brecha.
Audex emplea un diseño simplificado y eficiente, basado en una sólida arquitectura de Mezcla de Expertos (MoE) puramente textual. Al utilizar un único decodificador Transformer, procesa simultáneamente tokens de texto y tokens de audio cuantizados. Este enfoque proyecta las entradas de audio en el espacio de incrustación de texto, garantizando una integración perfecta con la infraestructura existente de LLM para tareas multimodales y logrando una verdadera integración profunda.
El entrenamiento involucró conjuntos de datos extensos que comprendían 157.4 mil millones de tokens de audio y 320.5 mil millones de tokens de texto. Mediante entrenamiento supervisado en múltiples etapas, Aprendizaje por Refuerzo en Cascada puramente textual y destilación de conocimiento multi-dominio en política, Audex logra un rendimiento líder en la industria en comprensión de audio, reconocimiento de voz, traducción y generación. Crucialmente, preserva las capacidades centrales del LLM original en razonamiento, alineación, recuperación de conocimiento y procesamiento de texto largo con una degradación mínima.
Como modelo de código abierto, Audex marca un hito significativo para el sector de la tecnología de voz. Al ir más allá de la investigación teórica, ofrece una solución madura para que los desarrolladores evalúen e implementen directamente. Para aquellos que gestionan interacciones de audio complejas, Audex proporciona una opción equilibrada que mejora el rendimiento mientras abre nuevas vías para la investigación de la inteligencia multimodal.
Artículo relacionado
Claude Opus 5.2 Gris Nocturno se lanza con respuesta más rápida, solucionando el problema de la pereza
Opus 5.2 se lanzó discretamente esta mañana, lo que llevó a muchos desarrolladores a notar que el modelo actualizado, Claude Opus 5.2, ha comenzado un lanzamiento limitado dentro de Claude Code.Anoche, los usuarios de X observaron que invocar Opus 5
Fireworks AI presenta FireRouter con Opus: reduce los costes de codificación en un 57% con una caída mínima de la precisión
Fireworks AI ha presentado FireRouter con Opus, el primer sistema de enrutamiento consciente del caché del sector, diseñado específicamente para la serie Claude Opus. Ahora disponible a través de un punto final sin servidor, este modelo de enrutamien
Cómo corregir las Core Web Vitals para el SEO en dispositivos móviles
Impulsa el SEO Local: Construye Pilas de Nube de Entidades de Google DriveTabla de Contenidos:IntroducciónComprensión de las Pilas de Nube de Entidades de GoogleBeneficios Clave de las Pilas de Nube de Entidades de GoogleCómo Comenzar con las Pi
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

A medida que los modelos grandes multimodales evolucionan rápidamente, las capacidades de procesamiento de audio se ven frecuentemente comprometidas; muchos modelos mejoran la comprensión del audio a expensas de la lógica textual. Para abordar esto, los investigadores de NVIDIA han presentado Nemotron-Labs-Audex-30B-A3B (Audex), un modelo de lenguaje grande unificado de audio-texto diseñado para cerrar esta brecha.
Audex emplea un diseño simplificado y eficiente, basado en una sólida arquitectura de Mezcla de Expertos (MoE) puramente textual. Al utilizar un único decodificador Transformer, procesa simultáneamente tokens de texto y tokens de audio cuantizados. Este enfoque proyecta las entradas de audio en el espacio de incrustación de texto, garantizando una integración perfecta con la infraestructura existente de LLM para tareas multimodales y logrando una verdadera integración profunda.
El entrenamiento involucró conjuntos de datos extensos que comprendían 157.4 mil millones de tokens de audio y 320.5 mil millones de tokens de texto. Mediante entrenamiento supervisado en múltiples etapas, Aprendizaje por Refuerzo en Cascada puramente textual y destilación de conocimiento multi-dominio en política, Audex logra un rendimiento líder en la industria en comprensión de audio, reconocimiento de voz, traducción y generación. Crucialmente, preserva las capacidades centrales del LLM original en razonamiento, alineación, recuperación de conocimiento y procesamiento de texto largo con una degradación mínima.
Como modelo de código abierto, Audex marca un hito significativo para el sector de la tecnología de voz. Al ir más allá de la investigación teórica, ofrece una solución madura para que los desarrolladores evalúen e implementen directamente. Para aquellos que gestionan interacciones de audio complejas, Audex proporciona una opción equilibrada que mejora el rendimiento mientras abre nuevas vías para la investigación de la inteligencia multimodal.
Claude Opus 5.2 Gris Nocturno se lanza con respuesta más rápida, solucionando el problema de la pereza
Opus 5.2 se lanzó discretamente esta mañana, lo que llevó a muchos desarrolladores a notar que el modelo actualizado, Claude Opus 5.2, ha comenzado un lanzamiento limitado dentro de Claude Code.Anoche, los usuarios de X observaron que invocar Opus 5
Fireworks AI presenta FireRouter con Opus: reduce los costes de codificación en un 57% con una caída mínima de la precisión
Fireworks AI ha presentado FireRouter con Opus, el primer sistema de enrutamiento consciente del caché del sector, diseñado específicamente para la serie Claude Opus. Ahora disponible a través de un punto final sin servidor, este modelo de enrutamien
Cómo corregir las Core Web Vitals para el SEO en dispositivos móviles
Impulsa el SEO Local: Construye Pilas de Nube de Entidades de Google DriveTabla de Contenidos:IntroducciónComprensión de las Pilas de Nube de Entidades de GoogleBeneficios Clave de las Pilas de Nube de Entidades de GoogleCómo Comenzar con las Pi











