Maison
Le laboratoire Tongyi d'Alibaba met Fun-CineForge en open source et relève le défi du doublage multilingue
Le doublage vocal traditionnel basé sur l'IA se révèle souvent insuffisant dans les productions à fort enjeu telles que les films et les animations, où il est primordial de saisir les nuances émotionnelles et d'assurer une synchronisation parfaite des mouvements des lèvres. Pour relever ce défi majeur du secteur, Tongyi Lab a officiellement lancé et mis en open source Fun-CineForge , un modèle de doublage multimodal révolutionnaire de qualité cinématographique, adapté à de multiples scénarios.
Combler le fossé audiovisuel : un cadre en quatre piliers pour une synchronisation parfaite
Plutôt que de s'appuyer sur une simple synthèse vocale, Fun-CineForge est conçu pour maîtriser quatre dimensions essentielles du doublage professionnel :
Synchronisation labiale : garantit que la parole synthétisée s'aligne avec une précision exceptionnelle sur les mouvements de la bouche des personnages à l'écran.
Expression émotionnelle : insuffle à la voix des émotions authentiques, semblables à celles d'un être humain, en analysant les expressions faciales et les instructions contextuelles.
Cohérence vocale : maintient une identité vocale stable et reconnaissable pour des personnages spécifiques dans des scènes de dialogue complexes impliquant plusieurs locuteurs.
Alignement temporel : permet l'insertion de dialogues avec une précision à la milliseconde près, même lorsque le locuteur est hors champ ou partiellement masqué.
Innovation fondamentale : la « modalité temporelle » pionnière et un ensemble de données haute fidélité
Le bond en avant technique de Fun-CineForge découle de sa philosophie unique de co-conception « données + modèle » :

L'ensemble de données haute qualité CineDub : le laboratoire Tongyi a également mis en open source le pipeline automatisé de construction de l'ensemble de données CineDub. Grâce à un mécanisme de correction d'erreurs par chaîne de pensée, il réduit les taux d'erreurs de transcription pour les textes en chinois et en anglais à environ 1 % - 2 % et ramène les erreurs de diarisation des locuteurs à seulement 1,2 %.
Architecture de fusion à quatre modalités : le modèle est le premier à intégrer une « modalité temporelle », modélisant conjointement les entrées visuelles (forme des lèvres et expression), le texte (dialogue et contexte émotionnel) et l'audio (référence vocale). Cette fusion permet une synchronisation parfaite dans les scènes difficiles, y compris celles où les visages ne sont pas visibles.
Excellence démontrée : un doublage de dialogues à plusieurs personnages authentique et novateur
Les résultats des tests de performance montrent que Fun-CineForge surpasse largement les modèles de référence tels que DeepDubber-V1 sur des indicateurs clés : taux d'erreur sur les mots (WER/CER), synchronisation labiale (LSE-C/D) et similarité vocale. Une avancée majeure réside dans sa capacité unique à gérer avec précision les dialogues en duo et à plusieurs personnages, faisant preuve d'une robustesse remarquable sur des clips vidéo pouvant atteindre 30 secondes.
GitHub : https://github.com/FunAudioLLM/FunCineForge
HuggingFace : https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope : https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
Article connexe
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles
Guident exploite une navette AuveTech dans le sud de la Floride, gérant un parcours de quatre miles à West Palm Beach et un parcours d’un mile à Boca Raton grâce à sa technologie de surveillance à dis
Recommandations de sujets spéciaux liés
commentaires (0)
Le doublage vocal traditionnel basé sur l'IA se révèle souvent insuffisant dans les productions à fort enjeu telles que les films et les animations, où il est primordial de saisir les nuances émotionnelles et d'assurer une synchronisation parfaite des mouvements des lèvres. Pour relever ce défi majeur du secteur, Tongyi Lab a officiellement lancé et mis en open source
Combler le fossé audiovisuel : un cadre en quatre piliers pour une synchronisation parfaite
Plutôt que de s'appuyer sur une simple synthèse vocale, Fun-CineForge est conçu pour maîtriser quatre dimensions essentielles du doublage professionnel :
Synchronisation labiale : garantit que la parole synthétisée s'aligne avec une précision exceptionnelle sur les mouvements de la bouche des personnages à l'écran.
Expression émotionnelle : insuffle à la voix des émotions authentiques, semblables à celles d'un être humain, en analysant les expressions faciales et les instructions contextuelles.
Cohérence vocale : maintient une identité vocale stable et reconnaissable pour des personnages spécifiques dans des scènes de dialogue complexes impliquant plusieurs locuteurs.
Alignement temporel : permet l'insertion de dialogues avec une précision à la milliseconde près, même lorsque le locuteur est hors champ ou partiellement masqué.
Innovation fondamentale : la « modalité temporelle » pionnière et un ensemble de données haute fidélité
Le bond en avant technique de Fun-CineForge découle de sa philosophie unique de co-conception « données + modèle » :

L'ensemble de données haute qualité CineDub : le laboratoire Tongyi a également mis en open source le pipeline automatisé de construction de l'ensemble de données CineDub. Grâce à un mécanisme de correction d'erreurs par chaîne de pensée, il réduit les taux d'erreurs de transcription pour les textes en chinois et en anglais à environ 1 % - 2 % et ramène les erreurs de diarisation des locuteurs à seulement 1,2 %.
Architecture de fusion à quatre modalités : le modèle est le premier à intégrer une « modalité temporelle », modélisant conjointement les entrées visuelles (forme des lèvres et expression), le texte (dialogue et contexte émotionnel) et l'audio (référence vocale). Cette fusion permet une synchronisation parfaite dans les scènes difficiles, y compris celles où les visages ne sont pas visibles.
Excellence démontrée : un doublage de dialogues à plusieurs personnages authentique et novateur
Les résultats des tests de performance montrent que Fun-CineForge surpasse largement les modèles de référence tels que DeepDubber-V1 sur des indicateurs clés : taux d'erreur sur les mots (WER/CER), synchronisation labiale (LSE-C/D) et similarité vocale. Une avancée majeure réside dans sa capacité unique à gérer avec précision les dialogues en duo et à plusieurs personnages, faisant preuve d'une robustesse remarquable sur des clips vidéo pouvant atteindre 30 secondes.
GitHub : https://github.com/FunAudioLLM/FunCineForge
HuggingFace : https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope : https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés











