option
Maison
Nouvelles
Le modèle audio open source de Meituan établit une nouvelle référence en matière de clonage vocal

Le modèle audio open source de Meituan établit une nouvelle référence en matière de clonage vocal

6 avril 2026
311

La génération audio connaît actuellement une évolution fondamentale, passant d'architectures en cascade à plusieurs étapes à des modèles de bout en bout. Afin de pallier la perte d'informations et l'accumulation d'erreurs inhérentes à la représentation intermédiaire traditionnelle « spectrogramme Mel » utilisée dans les systèmes de synthèse vocale (TTS), l'équipe Meituan LongCat a officiellement publié et mis en open source LongCat-AudioDiT (disponible en versions 1B et 3,5B de paramètres). Ce modèle dépasse avec succès les limites de performance précédentes en matière de clonage vocal « zero-shot » en effectuant une modélisation directe de l'espace latent des formes d'onde.

QQ20260402-101320.jpg

Architecture de base : aller au-delà des spectrogrammes Mel

LongCat-AudioDiT abandonne le pipeline conventionnel en plusieurs étapes « prédiction des caractéristiques acoustiques + vocodeur neuronal » pour établir à la place une architecture minimale rationalisée reposant sur un Wav-VAE (Waveform Variational Autoencoder) et un DiT (Diffusion Transformer).

Wav-VAE efficace : grâce à une conception entièrement convolutive, il compresse les formes d'onde de 24 kHz d'un facteur de 2 000 pour atteindre une fréquence d'échantillonnage de 11,7 Hz. Grâce à des branches de raccourci non paramétriques et à un apprentissage antagoniste multi-objectifs, il garantit que la forme d'onde reconstruite conserve une structure temps-fréquence précise tout en offrant une excellente qualité d'écoute naturelle.

DiT à sémantique améliorée : le modèle fusionne de manière innovante les plongements de mots originaux provenant de l'encodeur de texte UMT5 avec ses états cachés de niveau supérieur. Cela compense les détails phonétiques perdus dans les représentations sémantiques de haut niveau, améliorant considérablement l'intelligibilité de la parole générée.

Optimisation de l'inférence : correction précise de la dérive vocale

Afin d'améliorer encore la qualité de la génération, l'équipe a mis en œuvre deux améliorations techniques essentielles :

Mécanisme à double contrainte : cette technique identifie et corrige le problème persistant de « décalage entre l'entraînement et l'inférence » dans la synthèse vocale par adaptation de flux. En réinitialisant de force les variables latentes dans la zone de prompt pendant l'inférence, elle résout complètement les problèmes de dérive et d'instabilité de la voix du locuteur.

Guidage par projection adaptative (APG) : l'APG remplace le guidage traditionnel sans classificateur (CFG). Il permet de filtrer avec précision les composantes bénéfiques du signal de guidage tout en supprimant celles qui causent une dégradation audio, améliorant ainsi considérablement le naturel de la parole sans induire de « sursaturation » spectrale.

Performances : précision de clonage de niveau SOTA

Lors des tests de référence sur l'ensemble de données Seed, LongCat-AudioDiT affiche des performances dominantes :

Similitude (SIM) : le modèle 3,5B a obtenu un score de 0,818 sur l'ensemble de test Seed-ZH et de 0,797 sur l'ensemble de phrases Seed-Hard, plus difficile, surpassant des modèles notables tels que Seed-TTS, CosyVoice3.5 et MiniMax-Speech.

Précision : il se classe parmi les meilleurs de l'industrie pour les indicateurs clés, avec notamment un WER de 1,50 % en anglais et un CER de 6,04 % pour les phrases difficiles en chinois.

Il est remarquable de constater que LongCat-AudioDiT obtient des résultats supérieurs à ceux des modèles entraînés en plusieurs étapes, en utilisant uniquement un entraînement en une seule étape sur des données de transcription ASR prétraitées. L'article de recherche associé, le code source et les poids du modèle sont désormais entièrement open source et disponibles sur GitHub et HuggingFace.

Liens vers le projet :

GitHub : https://github.com/meituan-longcat/LongCat-AudioDiT

HuggingFace : https://huggingface.co/meituan-longcat/LongCat-AudioDiT

Article connexe
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin. PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin. Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles Guident exploite une navette AuveTech dans le sud de la Floride, gérant un parcours de quatre miles à West Palm Beach et un parcours d’un mile à Boca Raton grâce à sa technologie de surveillance à dis
Recommandations de sujets spéciaux liés
en écrivant Outils d'IA pour la structuration d'articles destinés à la rédaction de textes longs
Outils d'IA pour la structuration d'articles destinés à la rédaction de textes longs

2026 : les meilleurs outils d'aide à la rédaction de plans pour les textes longs, sélectionnés parmi les mieux notés ! Cette sélection rigoureuse regroupe des outils puissants et révolutionnaires qui fournissent des plans précis et structurés, validés par des tests concrets, afin d'améliorer considérablement l'efficacité de la rédaction. XIX.AI fait partie de cette sélection d'élite. Consultez notre comparatif entre les versions gratuites et payantes pour vous aider à choisir l'outil idéal. Découvrez-les dès maintenant et tirez parti de l'IA !

9 outils
xix.ai
chatbot Meilleures applications de chat de jeu de rôle par IA pour la pratique des langues, la préparation aux entretiens et la fluidité quotidienne
Meilleures applications de chat de jeu de rôle par IA pour la pratique des langues, la préparation aux entretiens et la fluidité quotidienne

2026 Dernières Meilleures Applications de Chat IA pour le Jeu de Rôle, les plus bien notées pour la Pratique des Langues, la Préparation aux Entretiens et la Fluidité Quotidienne ! XIX.AI sélectionne une collection puissante et révolutionnaire qui propose une comparaison gratuit vs payant, des tests en conditions réelles et des classements mis à jour chaque semaine. Ces outils à essayer absolument vous aident à améliorer vos compétences en écriture, à surmonter les défis de fluidité et à optimiser l’efficacité de la communication dans tous les scénarios quotidiens. Explorez dès maintenant pour découvrir l’outil parfait pour votre progression linguistique !

10 outils
xix.ai
Composition musicale Outils de séparation des pistes audio par IA pour la production de remix, la préparation de samples et les masters de karaoké
Outils de séparation des pistes audio par IA pour la production de remix, la préparation de samples et les masters de karaoké

2026 : Les meilleures et plus récentes outils de séparation des pistes audio par IA, hautement notés, sélectionnés spécialement pour la production de remix, la préparation de samples et l’enregistrement de karaokés. Ces outils puissants et révolutionnaires, éprouvés dans des conditions réelles, permettent une isolation audio précise, ce qui améliore considérablement la productivité. XIX.AI propose un guide de comparaison gratuit mis à jour chaque semaine entre les versions payantes et gratuites, afin de vous aider à trouver la solution idéale adaptée à vos besoins. Découvrez-les dès maintenant pour tirer parti des avantages offerts par l’IA.

8 outils
xix.ai
Analyse des données Copilotes SQL basés sur l’IA pour les tableaux de bord de chiffre d’affaires, l’analyse des funnels et les indicateurs de produits
Copilotes SQL basés sur l’IA pour les tableaux de bord de chiffre d’affaires, l’analyse des funnels et les indicateurs de produits

2026 : Les meilleurs copilotes AI SQL actuels, classés parmi les plus performants ! XIX.AI a sélectionné une collection puissante et révolutionnaire, mise à jour chaque semaine grâce à des tests concrets. Ces outils indispensables vous aident à créer des tableaux de bord financiers précis, à analyser les canaux de vente et à suivre en temps réel les indicateurs produits, ce qui améliore considérablement votre productivité. Découvrez-les dès maintenant pour trouver l’outil idéal pour des décisions basées sur les données ! 238 caractères

9 outils
xix.ai
Composition musicale Meilleurs outils d’écriture de mélodies par IA pour les ébauches de chansons
Meilleurs outils d’écriture de mélodies par IA pour les ébauches de chansons

2026 Derniers Meilleurs Outils d’Écriture de Mélodie par IA les Mieux Notés pour des Ébauches de Chansons ! XIX.AI a sélectionné une collection hautement puissante et révolutionnaire, soumise à des tests rigoureux en conditions réelles, afin d’offrir la meilleure expérience d’écriture. Vous pouvez y trouver des comparaisons détaillées entre versions gratuites et payantes, des classements précis, ainsi que des options incontournables conçues pour vous aider à créer sans effort des ébauches de chansons remarquables et à booster significativement votre productivité créative. Explorez dès maintenant pour découvrir l’outil qui vous correspond parfaitement !

8 outils
xix.ai
chatbot Meilleurs outils d’entraînement à la conversation par IA pour la préparation aux entretiens
Meilleurs outils d’entraînement à la conversation par IA pour la préparation aux entretiens

Les derniers outils de formation à la conversation par IA les mieux notés pour 2026 sont disponibles sur XIX.AI ! Cette sélection rigoureuse propose des outils puissants et révolutionnaires, testés rigoureusement dans des conditions réelles pour fournir des retours précis. Vous y trouverez une comparaison entre les versions gratuites et payantes, ainsi que des classements détaillés pour vous aider à choisir l’option incontournable qui renforce votre confiance et vos compétences. Explorez dès maintenant pour découvrir l’outil parfait pour réussir vos entretiens !

12 outils
xix.ai
commentaires (1)
0/500
FredGreen
FredGreen 25 juin 2026 14:00:13 UTC+02:00

Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅

OR