Maison
Tongyi, filiale d'Alibaba, dévoile Fun-CineForge : un modèle d'IA open source capable de produire une synthèse vocale de qualité cinématographique
Le 16 mars, Alibaba Tongyi Lab a officiellement lancé et mis en open source Fun-CineForge, un modèle multimodal de synthèse vocale de qualité cinématographique adapté à de multiples scénarios. Ce modèle s'attaque aux principaux défis du doublage par IA, notamment le décalage entre les lèvres et la voix, le manque d'expression émotionnelle et l'incohérence des caractéristiques vocales entre plusieurs personnages. Il propose également une méthode de haute qualité pour la construction d'ensembles de données.

Sur le plan technique, Fun-CineForge est le pionnier du concept de « modalité temporelle ». Contrairement aux modèles conventionnels qui se concentrent uniquement sur le texte ou les visuels, il garantit que la synthèse vocale s'effectue dans des intervalles de temps précis grâce à un contrôle précis des horodatages. Même dans des scènes de film complexes comportant des personnages masqués, des changements fréquents de plan ou des visages flous, le modèle maintient un haut degré de synchronisation audiovisuelle et de respect des instructions.
Le pipeline de construction de l'ensemble de données open source CineDub qui l'accompagne constitue une autre innovation majeure. Le laboratoire Tongyi a utilisé le raisonnement par chaîne de pensée des grands modèles linguistiques pour transformer automatiquement les séquences brutes de films en données structurées, réduisant ainsi considérablement le besoin d'annotation manuelle. Ce processus atteint un taux d'erreur sur les mots d'environ 1 % et un taux d'erreur de diarisation des locuteurs de seulement 1,20 %, offrant ainsi une base d'entraînement hautement compétitive pour les grands modèles.

Fun-CineForge est désormais disponible sur GitHub, HuggingFace et la communauté ModelScope, et prend en charge l'inférence pour des clips vidéo d'une durée maximale de 30 secondes. Il excelle non seulement dans les monologues à locuteur unique, mais offre également une prise en charge de niveau professionnel pour les scénarios de dialogues en duo et à locuteurs multiples. Cette avancée marque l'évolution de la technologie vocale IA, qui passe de rôles basiques de service client et d'assistant à des applications de post-production cinématographique et d'animation de haut niveau.
GitHub : https://github.com/FunAudioLLM/FunCineForge
HuggingFace : https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope : https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
Article connexe
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles
Guident exploite une navette AuveTech dans le sud de la Floride, gérant un parcours de quatre miles à West Palm Beach et un parcours d’un mile à Boca Raton grâce à sa technologie de surveillance à dis
Recommandations de sujets spéciaux liés
commentaires (1)
Just tried the demo and honestly blown away by how natural the lip-sync feels now! 😮 Always thought AI dubbing sounded a bit robotic, but this seems like a huge leap. Wonder if this will start being used in indie films or even gaming soon? The open-source move is pretty bold too—curious to see how other companies respond.
Le 16 mars, Alibaba Tongyi Lab a officiellement lancé et mis en open source Fun-CineForge, un modèle multimodal de synthèse vocale de qualité cinématographique adapté à de multiples scénarios. Ce modèle s'attaque aux principaux défis du doublage par IA, notamment le décalage entre les lèvres et la voix, le manque d'expression émotionnelle et l'incohérence des caractéristiques vocales entre plusieurs personnages. Il propose également une méthode de haute qualité pour la construction d'ensembles de données.

Sur le plan technique, Fun-CineForge est le pionnier du concept de « modalité temporelle ». Contrairement aux modèles conventionnels qui se concentrent uniquement sur le texte ou les visuels, il garantit que la synthèse vocale s'effectue dans des intervalles de temps précis grâce à un contrôle précis des horodatages. Même dans des scènes de film complexes comportant des personnages masqués, des changements fréquents de plan ou des visages flous, le modèle maintient un haut degré de synchronisation audiovisuelle et de respect des instructions.
Le pipeline de construction de l'ensemble de données open source CineDub qui l'accompagne constitue une autre innovation majeure. Le laboratoire Tongyi a utilisé le raisonnement par chaîne de pensée des grands modèles linguistiques pour transformer automatiquement les séquences brutes de films en données structurées, réduisant ainsi considérablement le besoin d'annotation manuelle. Ce processus atteint un taux d'erreur sur les mots d'environ 1 % et un taux d'erreur de diarisation des locuteurs de seulement 1,20 %, offrant ainsi une base d'entraînement hautement compétitive pour les grands modèles.

Fun-CineForge est désormais disponible sur GitHub, HuggingFace et la communauté ModelScope, et prend en charge l'inférence pour des clips vidéo d'une durée maximale de 30 secondes. Il excelle non seulement dans les monologues à locuteur unique, mais offre également une prise en charge de niveau professionnel pour les scénarios de dialogues en duo et à locuteurs multiples. Cette avancée marque l'évolution de la technologie vocale IA, qui passe de rôles basiques de service client et d'assistant à des applications de post-production cinématographique et d'animation de haut niveau.
GitHub : https://github.com/FunAudioLLM/FunCineForge
HuggingFace : https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope : https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Just tried the demo and honestly blown away by how natural the lip-sync feels now! 😮 Always thought AI dubbing sounded a bit robotic, but this seems like a huge leap. Wonder if this will start being used in indie films or even gaming soon? The open-source move is pretty bold too—curious to see how other companies respond.











