Maison
Meituan met en open source LongCat-Video-Avatar 1.5, qui surpasse les modèles propriétaires courants
L'équipe chargée des grands modèles « LongCat » de Meituan a officiellement mis en open source LongCat-Video-Avatar 1.5, un modèle de génération de vidéos mettant en scène des personnages numériques de qualité commerciale. Cette version marque le passage définitif d’une technologie open source de pointe à un déploiement commercial concret, avec des améliorations majeures en matière de synchronisation labiale, de réalisme physique, de stabilité des vidéos longues, d’interactions entre plusieurs personnes et d’efficacité de l’inférence.
Trois améliorations clés pour surmonter les obstacles à la commercialisation
Afin de garantir un fonctionnement fiable des personnages numériques dans diverses applications concrètes, LongCat-Video-Avatar 1.5 s'attaque à des problèmes persistants tels que la gigue, la distorsion et la latence élevée dans les vidéos traditionnelles de personnages numériques grâce à trois améliorations globales :
Amélioration de l’encodage audio de qualité commerciale
L’encodeur d’extraction des caractéristiques audio du modèle est passé de Wav2Vec2 à Whisper-large. Grâce à un plus grand nombre de paramètres et à des connaissances a priori multilingues plus riches, il capture désormais les variations subtiles des phonèmes et le rythme de la parole. Cela améliore la synchronisation labiale pour les contenus audio complexes tels que les longues phrases, les discours rapides et le chant, tout en permettant une coordination naturelle entre les expressions faciales, les mouvements de la tête et la parole — ce qui réduit considérablement les sauts d’images et la dérive d’identité dans les vidéos plus longues.
Généralisation robuste en domaine ouvert grâce à l’enrichissement des données en plusieurs étapes
Afin de garantir des performances stables sur des sujets variés — personnes réelles, idoles virtuelles, personnages d’anime et animaux —, l’équipe a développé un pipeline de données en plusieurs étapes intégrant une annotation hors ligne et une validation en ligne, et a introduit trois types ciblés de données améliorées :
Données multi-personnes: grâce à la détection active des locuteurs, ce pipeline élimine l’ambiguïté audiovisuelle dans les scènes impliquant plusieurs personnes, en distinguant avec précision les locuteurs des auditeurs.
Données silencieuses: en sélectionnant des vidéos sans parole, le modèle apprend les micro-expressions naturelles pendant les moments de silence, ce qui évite les mouvements de bouche indésirables chez les personnages qui ne parlent pas.
Données émotionnelles: combinées à un filtrage de reconnaissance des émotions au niveau de chaque image, elles intègrent les variations émotionnelles, aidant ainsi le modèle à saisir le lien profond entre la parole et les expressions faciales.
Alignement des mains et continuité temporelle avec le GRPO
Pour des cas d’utilisation tels que les diffusions en direct dans le cadre du commerce électronique et les démonstrations de produits, où les mains sont fréquemment visibles, le modèle intègre le GRPO (Human Preference Alignment), qui affine les signaux de récompense au niveau de l’image et ajoute un mécanisme de détection des mains dès la première image. Cela réduit considérablement les problèmes courants tels que la distorsion des mains, l’effondrement structurel local et les mouvements incohérents.

Une inférence 15 fois plus rapide : élimination des exigences de calcul coûteuses
Le coût est un autre facteur critique pour le déploiement commercial. LongCat-Video-Avatar 1.5 utilise la technologie DMD (Distributed Matching Distillation), qui compresse le processus de génération initial de 50 étapes à seulement 8 étapes. De plus, l’équipe a remplacé la configuration parallèle classique à trois modèles par un modèle de base unique partagé associé à plusieurs adaptateurs LoRA, ce qui réduit considérablement l’utilisation de la VRAM.
Lors de tests en conditions réelles, le modèle offre une inférence environ 15 fois plus rapide, générant une vidéo de 10 secondes en environ une minute.
Évaluation comparative : des performances supérieures à celles des meilleurs modèles du secteur
À l’aide du benchmark EvalTalker, 770 évaluateurs et 10 experts du domaine ont réalisé une analyse structurée de la qualité sur des vidéos issues de domaines complexes, notamment l’actualité, l’éducation et le divertissement. Les résultats montrent que LongCat-Video-Avatar 1.5 excelle sur plusieurs indicateurs clés :
Taux de réussite en termes de préférences des utilisateurs: il devance Kling Avatar 2.0 de 65,9 %, OmniHuman-1.5 de 61,1 % et HeyGen de 54,3 %.
Scores dans les scénarios à une ou plusieurs personnes: le score dans le scénario à une personne atteint 3,336, bien au-dessus de concurrents tels que HeyGen ; le score dans le scénario à plusieurs personnes est de 2,730, surpassant nettement InfiniteTalk (2,339).
Stabilité vidéo: le taux de déformation du sujet n’est que de 23,1 %, et celui de l’arrière-plan de seulement 9,4 % ;le taux de saut d’images n’est que de 0,8 %, le meilleur résultat parmi tous les modèles comparés.
Coordination audiovisuelle: le taux de problèmes de synchronisation visage-corps est tombé à 5,1 %, et celui des problèmes de synchronisation labiale à 29,8 %, ces deux chiffres surpassant ceux des systèmes commerciaux traditionnels.
L’équipe chargée du grand modèle LongCat de Meituan affirme que la mise en open source de LongCat-Video-Avatar 1.5 est bien plus qu’une simple mise à jour de version : il s’agit d’une invitation adressée à la communauté mondiale des développeurs et des créateurs. Elle espère que ce modèle servira de base technique vérifiable et perfectible, contribuant ainsi à repousser les limites concrètes des applications vidéo utilisant des avatars numériques.
Liens vers l’open source :
Github : https://github.com/meituan-longcat/LongCat-Video
HuggingFace : https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
Rapport technique : https://github.com/meituan-longcat/LongCat-Video/blob/main/assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf
Page du projet : https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
Modelscope : https://www.modelscope.cn/models/meituan-longcat/LongCat-Video-Avatar-1.5/summary
Article connexe
Le statut de « licorne » de Preply témoigne de la résilience ukrainienne
La plateforme d’apprentissage des langues Preply a atteint une valorisation de 1,2 milliard de dollars à l’issue d’un tour de table de série D de 150 millions de dollars, marquant ainsi une étape impo
Wang Xingxing : l'IA incarnée devrait connaître une avancée comparable à celle de ChatGPT d'ici deux à trois ans
Wang Xingxing, fondateur et PDG de BotSchool, a souligné lors de son intervention au forum principal de la Conférence mondiale sur la robotique 2026 (WRC2026) que l’intelligence incarnée s’approchait
Microsoft relance sa stratégie en matière d’intelligence artificielle avec un nouveau modèle de codage alors que les coûts de Claude augmentent
La programmation assistée par l’IA est devenue un élément incontournable du développement logiciel moderne, mais même les géants de la technologie comme Microsoft ressentent le poids des abonnements coûteux aux grands modèles de langage tiers. Pour r
Recommandations de sujets spéciaux liés
commentaires (0)
L'équipe chargée des grands modèles « LongCat » de Meituan a officiellement mis en open source LongCat-Video-Avatar 1.5, un modèle de génération de vidéos mettant en scène des personnages numériques de qualité commerciale. Cette version marque le passage définitif d’une technologie open source de pointe à un déploiement commercial concret, avec des améliorations majeures en matière de synchronisation labiale, de réalisme physique, de stabilité des vidéos longues, d’interactions entre plusieurs personnes et d’efficacité de l’inférence.
Trois améliorations clés pour surmonter les obstacles à la commercialisation
Afin de garantir un fonctionnement fiable des personnages numériques dans diverses applications concrètes, LongCat-Video-Avatar 1.5 s'attaque à des problèmes persistants tels que la gigue, la distorsion et la latence élevée dans les vidéos traditionnelles de personnages numériques grâce à trois améliorations globales :
Amélioration de l’encodage audio de qualité commerciale
L’encodeur d’extraction des caractéristiques audio du modèle est passé de Wav2Vec2 à Whisper-large. Grâce à un plus grand nombre de paramètres et à des connaissances a priori multilingues plus riches, il capture désormais les variations subtiles des phonèmes et le rythme de la parole. Cela améliore la synchronisation labiale pour les contenus audio complexes tels que les longues phrases, les discours rapides et le chant, tout en permettant une coordination naturelle entre les expressions faciales, les mouvements de la tête et la parole — ce qui réduit considérablement les sauts d’images et la dérive d’identité dans les vidéos plus longues.
Généralisation robuste en domaine ouvert grâce à l’enrichissement des données en plusieurs étapes
Afin de garantir des performances stables sur des sujets variés — personnes réelles, idoles virtuelles, personnages d’anime et animaux —, l’équipe a développé un pipeline de données en plusieurs étapes intégrant une annotation hors ligne et une validation en ligne, et a introduit trois types ciblés de données améliorées :
Données multi-personnes: grâce à la détection active des locuteurs, ce pipeline élimine l’ambiguïté audiovisuelle dans les scènes impliquant plusieurs personnes, en distinguant avec précision les locuteurs des auditeurs.
Données silencieuses: en sélectionnant des vidéos sans parole, le modèle apprend les micro-expressions naturelles pendant les moments de silence, ce qui évite les mouvements de bouche indésirables chez les personnages qui ne parlent pas.
Données émotionnelles: combinées à un filtrage de reconnaissance des émotions au niveau de chaque image, elles intègrent les variations émotionnelles, aidant ainsi le modèle à saisir le lien profond entre la parole et les expressions faciales.
Alignement des mains et continuité temporelle avec le GRPO
Pour des cas d’utilisation tels que les diffusions en direct dans le cadre du commerce électronique et les démonstrations de produits, où les mains sont fréquemment visibles, le modèle intègre le GRPO (Human Preference Alignment), qui affine les signaux de récompense au niveau de l’image et ajoute un mécanisme de détection des mains dès la première image. Cela réduit considérablement les problèmes courants tels que la distorsion des mains, l’effondrement structurel local et les mouvements incohérents.

Une inférence 15 fois plus rapide : élimination des exigences de calcul coûteuses
Le coût est un autre facteur critique pour le déploiement commercial. LongCat-Video-Avatar 1.5 utilise la technologie DMD (Distributed Matching Distillation), qui compresse le processus de génération initial de 50 étapes à seulement 8 étapes. De plus, l’équipe a remplacé la configuration parallèle classique à trois modèles par un modèle de base unique partagé associé à plusieurs adaptateurs LoRA, ce qui réduit considérablement l’utilisation de la VRAM.
Lors de tests en conditions réelles, le modèle offre une inférence environ 15 fois plus rapide, générant une vidéo de 10 secondes en environ une minute.
Évaluation comparative : des performances supérieures à celles des meilleurs modèles du secteur
À l’aide du benchmark EvalTalker, 770 évaluateurs et 10 experts du domaine ont réalisé une analyse structurée de la qualité sur des vidéos issues de domaines complexes, notamment l’actualité, l’éducation et le divertissement. Les résultats montrent que LongCat-Video-Avatar 1.5 excelle sur plusieurs indicateurs clés :
Taux de réussite en termes de préférences des utilisateurs: il devance Kling Avatar 2.0 de 65,9 %, OmniHuman-1.5 de 61,1 % et HeyGen de 54,3 %.
Scores dans les scénarios à une ou plusieurs personnes: le score dans le scénario à une personne atteint 3,336, bien au-dessus de concurrents tels que HeyGen ; le score dans le scénario à plusieurs personnes est de 2,730, surpassant nettement InfiniteTalk (2,339).
Stabilité vidéo: le taux de déformation du sujet n’est que de 23,1 %, et celui de l’arrière-plan de seulement 9,4 % ;le taux de saut d’images n’est que de 0,8 %, le meilleur résultat parmi tous les modèles comparés.
Coordination audiovisuelle: le taux de problèmes de synchronisation visage-corps est tombé à 5,1 %, et celui des problèmes de synchronisation labiale à 29,8 %, ces deux chiffres surpassant ceux des systèmes commerciaux traditionnels.
L’équipe chargée du grand modèle LongCat de Meituan affirme que la mise en open source de LongCat-Video-Avatar 1.5 est bien plus qu’une simple mise à jour de version : il s’agit d’une invitation adressée à la communauté mondiale des développeurs et des créateurs. Elle espère que ce modèle servira de base technique vérifiable et perfectible, contribuant ainsi à repousser les limites concrètes des applications vidéo utilisant des avatars numériques.
Liens vers l’open source :
Github : https://github.com/meituan-longcat/LongCat-Video
HuggingFace : https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
Rapport technique : https://github.com/meituan-longcat/LongCat-Video/blob/main/assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf
Page du projet : https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
Modelscope : https://www.modelscope.cn/models/meituan-longcat/LongCat-Video-Avatar-1.5/summary
Le statut de « licorne » de Preply témoigne de la résilience ukrainienne
La plateforme d’apprentissage des langues Preply a atteint une valorisation de 1,2 milliard de dollars à l’issue d’un tour de table de série D de 150 millions de dollars, marquant ainsi une étape impo
Wang Xingxing : l'IA incarnée devrait connaître une avancée comparable à celle de ChatGPT d'ici deux à trois ans
Wang Xingxing, fondateur et PDG de BotSchool, a souligné lors de son intervention au forum principal de la Conférence mondiale sur la robotique 2026 (WRC2026) que l’intelligence incarnée s’approchait
Microsoft relance sa stratégie en matière d’intelligence artificielle avec un nouveau modèle de codage alors que les coûts de Claude augmentent
La programmation assistée par l’IA est devenue un élément incontournable du développement logiciel moderne, mais même les géants de la technologie comme Microsoft ressentent le poids des abonnements coûteux aux grands modèles de langage tiers. Pour r











