Hogar
El modelo de audio de código abierto de Meituan establece un nuevo referente en la clonación de voces
La generación de audio está experimentando un cambio fundamental, pasando de arquitecturas en cascada de múltiples etapas a modelos de extremo a extremo. Para superar la pérdida de información y la acumulación de errores inherentes a la representación intermedia tradicional del «espectrograma Mel» utilizada en los sistemas TTS, el equipo de Meituan LongCat ha lanzado oficialmente y ha publicado en código abierto LongCat-AudioDiT (disponible en versiones de 1.000 millones y 3.500 millones de parámetros). Este modelo supera con éxito los límites de rendimiento anteriores en la clonación de voz sin entrenamiento previo mediante el modelado directo del espacio latente de la forma de onda.

Arquitectura central: más allá de los espectrogramas Mel
LongCat-AudioDiT descarta el proceso convencional de varias etapas de «predicción de características acústicas + vocoder neuronal», estableciendo en su lugar una arquitectura mínima optimizada basada en un Wav-VAE (Waveform Variational Autoencoder) y un DiT (Diffusion Transformer).
Wav-VAE eficiente: utilizando un diseño totalmente convolucional, comprime formas de onda de 24 kHz en un factor de 2000 a una frecuencia de fotogramas de 11,7 Hz. A través de ramificaciones de atajo no paramétricas y entrenamiento adversarial multiobjetivo, garantiza que la forma de onda reconstruida mantenga una estructura tiempo-frecuencia precisa, al tiempo que ofrece una excelente calidad de escucha natural.
DiT con semántica mejorada: El modelo fusiona de forma innovadora las incrustaciones de palabras originales del codificador de texto UMT5 con sus estados ocultos de nivel superior. Esto compensa los detalles fonéticos perdidos en las representaciones semánticas de alto nivel, lo que aumenta significativamente la inteligibilidad del habla generada.
Optimización de la inferencia: corrección precisa de la deriva de la voz
Para mejorar aún más la calidad de la generación, el equipo implementó dos mejoras técnicas fundamentales:
Mecanismo de doble restricción: esta técnica identifica y corrige el persistente problema de «desajuste entre entrenamiento e inferencia» en el TTS con coincidencia de flujo. Al restablecer forzosamente las variables latentes en el área de la indicación durante la inferencia, resuelve por completo los problemas de deriva e inestabilidad de la voz del hablante.
Orientación de proyección adaptativa (APG): La APG sustituye a la orientación tradicional sin clasificador (CFG). Es capaz de filtrar con precisión los componentes beneficiosos de la señal de orientación, al tiempo que suprime los componentes que causan degradación del audio, lo que mejora significativamente la naturalidad del habla sin provocar una «sobresaturación» espectral.
Rendimiento: precisión de clonación de nivel SOTA
En las pruebas de referencia con el conjunto de datos Seed, LongCat-AudioDiT demuestra un rendimiento dominante:
Similitud (SIM): El modelo de 3.500 millones de parámetros alcanzó una puntuación de 0,818 en el conjunto de pruebas Seed-ZH y de 0,797 en el exigente conjunto de frases Seed-Hard, superando a modelos destacados como Seed-TTS, CosyVoice3.5 y MiniMax-Speech.
Precisión: Se sitúa entre los mejores del sector en métricas clave, incluyendo un WER en inglés del 1,50 % y un CER en frases difíciles en chino del 6,04 %.
Cabe destacar que LongCat-AudioDiT logra resultados superiores en comparación con los modelos entrenados en múltiples etapas utilizando únicamente un entrenamiento de una sola etapa sobre datos de transcripción ASR preprocesados. El artículo de investigación asociado, el código fuente y los pesos del modelo son ahora de código abierto y están disponibles en GitHub y HuggingFace.
Enlaces del proyecto:
GitHub: https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-AudioDiT
Artículo relacionado
Las gafas inteligentes de Apple podrían debutar en la WWDC27, destacando la protección de la privacidad
El informe de Mark Gurman de Bloomberg indica que las gafas inteligentes de Apple, con el nombre en código N50, están previstas para su presentación en la WWDC27 de junio de 2027, con un lanzamiento al público previsto para el otoño de 2027. Original
Dentro de los detalles revelados sobre el Gemini de próxima generación: Potencia de cálculo limitada, los equipos internos discreparon sobre las prioridades de desarrollo y la asignación de recursos
Los informes indican que el lanzamiento del tan esperado modelo Gemini de próxima generación de Google ha sido pospuesto. Los desacuerdos internos sobre las prioridades de desarrollo y la asignación de recursos, combinados con una capacidad de comput
OpenAI descarta preocupaciones por la desaceleración del crecimiento y afirma que múltiples unidades de negocio están acelerando
En respuesta a la escrutinio externo sobre el desaceleramiento del crecimiento de las ventas y el incumplimiento de las metas internas, el líder en inteligencia artificial, OpenAI, emitió una declaración contundente el martes 28 de abril. La empresa
Recomendaciones de temas especiales relacionados
comentario (1)
0/500
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅
La generación de audio está experimentando un cambio fundamental, pasando de arquitecturas en cascada de múltiples etapas a modelos de extremo a extremo. Para superar la pérdida de información y la acumulación de errores inherentes a la representación intermedia tradicional del «espectrograma Mel» utilizada en los sistemas TTS, el equipo de Meituan LongCat ha lanzado oficialmente y ha publicado en código abierto LongCat-AudioDiT (disponible en versiones de 1.000 millones y 3.500 millones de parámetros). Este modelo supera con éxito los límites de rendimiento anteriores en la clonación de voz sin entrenamiento previo mediante el modelado directo del espacio latente de la forma de onda.

Arquitectura central: más allá de los espectrogramas Mel
LongCat-AudioDiT descarta el proceso convencional de varias etapas de «predicción de características acústicas + vocoder neuronal», estableciendo en su lugar una arquitectura mínima optimizada basada en un Wav-VAE (Waveform Variational Autoencoder) y un DiT (Diffusion Transformer).
Wav-VAE eficiente: utilizando un diseño totalmente convolucional, comprime formas de onda de 24 kHz en un factor de 2000 a una frecuencia de fotogramas de 11,7 Hz. A través de ramificaciones de atajo no paramétricas y entrenamiento adversarial multiobjetivo, garantiza que la forma de onda reconstruida mantenga una estructura tiempo-frecuencia precisa, al tiempo que ofrece una excelente calidad de escucha natural.
DiT con semántica mejorada: El modelo fusiona de forma innovadora las incrustaciones de palabras originales del codificador de texto UMT5 con sus estados ocultos de nivel superior. Esto compensa los detalles fonéticos perdidos en las representaciones semánticas de alto nivel, lo que aumenta significativamente la inteligibilidad del habla generada.
Optimización de la inferencia: corrección precisa de la deriva de la voz
Para mejorar aún más la calidad de la generación, el equipo implementó dos mejoras técnicas fundamentales:
Mecanismo de doble restricción: esta técnica identifica y corrige el persistente problema de «desajuste entre entrenamiento e inferencia» en el TTS con coincidencia de flujo. Al restablecer forzosamente las variables latentes en el área de la indicación durante la inferencia, resuelve por completo los problemas de deriva e inestabilidad de la voz del hablante.
Orientación de proyección adaptativa (APG): La APG sustituye a la orientación tradicional sin clasificador (CFG). Es capaz de filtrar con precisión los componentes beneficiosos de la señal de orientación, al tiempo que suprime los componentes que causan degradación del audio, lo que mejora significativamente la naturalidad del habla sin provocar una «sobresaturación» espectral.
Rendimiento: precisión de clonación de nivel SOTA
En las pruebas de referencia con el conjunto de datos Seed, LongCat-AudioDiT demuestra un rendimiento dominante:
Similitud (SIM): El modelo de 3.500 millones de parámetros alcanzó una puntuación de 0,818 en el conjunto de pruebas Seed-ZH y de 0,797 en el exigente conjunto de frases Seed-Hard, superando a modelos destacados como Seed-TTS, CosyVoice3.5 y MiniMax-Speech.
Precisión: Se sitúa entre los mejores del sector en métricas clave, incluyendo un WER en inglés del 1,50 % y un CER en frases difíciles en chino del 6,04 %.
Cabe destacar que LongCat-AudioDiT logra resultados superiores en comparación con los modelos entrenados en múltiples etapas utilizando únicamente un entrenamiento de una sola etapa sobre datos de transcripción ASR preprocesados. El artículo de investigación asociado, el código fuente y los pesos del modelo son ahora de código abierto y están disponibles en GitHub y HuggingFace.
Enlaces del proyecto:
GitHub: https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-AudioDiT
Las gafas inteligentes de Apple podrían debutar en la WWDC27, destacando la protección de la privacidad
El informe de Mark Gurman de Bloomberg indica que las gafas inteligentes de Apple, con el nombre en código N50, están previstas para su presentación en la WWDC27 de junio de 2027, con un lanzamiento al público previsto para el otoño de 2027. Original
Dentro de los detalles revelados sobre el Gemini de próxima generación: Potencia de cálculo limitada, los equipos internos discreparon sobre las prioridades de desarrollo y la asignación de recursos
Los informes indican que el lanzamiento del tan esperado modelo Gemini de próxima generación de Google ha sido pospuesto. Los desacuerdos internos sobre las prioridades de desarrollo y la asignación de recursos, combinados con una capacidad de comput
OpenAI descarta preocupaciones por la desaceleración del crecimiento y afirma que múltiples unidades de negocio están acelerando
En respuesta a la escrutinio externo sobre el desaceleramiento del crecimiento de las ventas y el incumplimiento de las metas internas, el líder en inteligencia artificial, OpenAI, emitió una declaración contundente el martes 28 de abril. La empresa
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅











