Maison
Tongyi Lab dévoile PrismAudio, une solution de séparation audiovisuelle bidirectionnelle
À une époque où la génération de vidéos par IA connaît un essor fulgurant, le décalage entre l’image et le son — qui se manifeste souvent par un silence ou un son mal synchronisé — reste un obstacle majeur à l’immersion du spectateur. Pour relever ce défi, le Tongyi Lab d’Alibaba a dévoilé PrismAudio, un nouveau framework de conversion vidéo-audio. Ces travaux de recherche, acceptés par la prestigieuse conférence sur l’IA ICLR 2026, se concentrent sur la synchronisation automatique de contenus vidéo avec des effets sonores ambiants précis.

Raisonnement avant la génération : maîtriser l’audio grâce à la « chaîne de pensée »
Les modèles classiques de génération audio fonctionnent généralement de manière « intuitive », produisant souvent des résultats décousus — comme des bruits de sabots de cheval ressemblant à des gazouillis d’oiseaux, ou un son en décalage par rapport à l’action visuelle. PrismAudio se distingue en adoptant une approche « planifier d’abord, générer ensuite ».
Chaîne de pensée par décomposition : avant de générer le son, le modèle analyse la vidéo image par image : il identifie les éléments de la scène, détermine le moment d’apparition des sons, évalue les caractéristiques audio (par exemple, la netteté ou la profondeur) et localise spatialement la source sonore.
Évaluation multidimensionnelle : afin de garantir un résultat de haute qualité, l’équipe de développement a intégré l’apprentissage par renforcement, en utilisant quatre « évaluateurs virtuels » pour noter les résultats selon quatre critères : la cohérence sémantique, la synchronisation temporelle, la qualité esthétique et la précision spatiale. Cette boucle de rétroaction à multiples facettes résout le problème courant des modèles précédents, qui optimisaient un aspect tout en en négligeant d’autres.
Léger et efficace : traitement de vidéos de 9 secondes en 0,6 seconde
Au-delà de la précision, PrismAudio offre une vitesse exceptionnelle. Grâce à son algorithme d’entraînement propriétaire Fast-GRPO, le modèle bénéficie d’un gain de performances substantiel tout en conservant son efficacité opérationnelle :
Architecture compacte, impact élevé : avec seulement 518 millions de paramètres, le modèle est nettement plus petit que les systèmes comparables, qui nécessitent souvent des dizaines de milliards de paramètres.
Réponse rapide : la génération d’un son de haute qualité pour un clip vidéo de 9 secondes ne prend que 0,63 seconde, ce qui se rapproche des performances en temps réel.
Perspective du secteur : l’essor de l’audio ambiant authentique
Le lancement de PrismAudio offre non seulement un outil d’automatisation robuste pour la post-production cinématographique et la création de vidéos courtes, mais il inspire également de nouvelles approches en matière de génération multi-objets. À mesure que l’IA améliore sa capacité à équilibrer la texture audio et le positionnement spatial, la production vidéo future atteindra de plus en plus une véritable fidélité selon le principe « ce que vous voyez est ce que vous entendez ».
Lien vers l'article : arXiv:2511.18833
Lien vers le code open source : https://prismaudio-project.github.io/
Article connexe
Neros Technologies lève 250 millions de dollars pour déployer des drones de défense d’ici 2026
Neros Archer : Un drone FPV conçu pour des charges utiles modulaires et des liens de communication résilients. | Source : NerosNeros Inc. a clôturé une levée de fonds de série C de 250 millions de dollars, portant la valorisation de l'entrepreneur en
Yushu Technology, première action de robots humanoïdes cotée sur le marché A, fixe son introduction en bourse au 19 août avec une valorisation d’environ 61 milliards de yuans
Prévue pour être cotée sur le tableau de l'innovation scientifique et technologique le 19 août, Yue Shu Technology fera ses débuts à 150,80 yuans par action, établissant une capitalisation boursière post-émission d'environ 60,993 milliards de yuans.
Le nœud Ali Zhenwu M890 Ultra est désormais compatible avec Qwen3.8, disponible sur la plateforme BaiLian pour l'inférence.
Alibaba Cloud a confirmé le 23 juillet que son super nœud Zhenwu M890 s’est intégré avec succès au dernier modèle d’IA de grande envergure phare, Qwen3.8, le rendant disponible pour les services d’inférence de modèles sur la plateforme Alibaba Cloud
Recommandations de sujets spéciaux liés
commentaires (0)
À une époque où la génération de vidéos par IA connaît un essor fulgurant, le décalage entre l’image et le son — qui se manifeste souvent par un silence ou un son mal synchronisé — reste un obstacle majeur à l’immersion du spectateur. Pour relever ce défi, le Tongyi Lab d’Alibaba a dévoilé PrismAudio, un nouveau framework de conversion vidéo-audio. Ces travaux de recherche, acceptés par la prestigieuse conférence sur l’IA ICLR 2026, se concentrent sur la synchronisation automatique de contenus vidéo avec des effets sonores ambiants précis.

Raisonnement avant la génération : maîtriser l’audio grâce à la « chaîne de pensée »
Les modèles classiques de génération audio fonctionnent généralement de manière « intuitive », produisant souvent des résultats décousus — comme des bruits de sabots de cheval ressemblant à des gazouillis d’oiseaux, ou un son en décalage par rapport à l’action visuelle. PrismAudio se distingue en adoptant une approche « planifier d’abord, générer ensuite ».
Chaîne de pensée par décomposition : avant de générer le son, le modèle analyse la vidéo image par image : il identifie les éléments de la scène, détermine le moment d’apparition des sons, évalue les caractéristiques audio (par exemple, la netteté ou la profondeur) et localise spatialement la source sonore.
Évaluation multidimensionnelle : afin de garantir un résultat de haute qualité, l’équipe de développement a intégré l’apprentissage par renforcement, en utilisant quatre « évaluateurs virtuels » pour noter les résultats selon quatre critères : la cohérence sémantique, la synchronisation temporelle, la qualité esthétique et la précision spatiale. Cette boucle de rétroaction à multiples facettes résout le problème courant des modèles précédents, qui optimisaient un aspect tout en en négligeant d’autres.
Léger et efficace : traitement de vidéos de 9 secondes en 0,6 seconde
Au-delà de la précision, PrismAudio offre une vitesse exceptionnelle. Grâce à son algorithme d’entraînement propriétaire Fast-GRPO, le modèle bénéficie d’un gain de performances substantiel tout en conservant son efficacité opérationnelle :
Architecture compacte, impact élevé : avec seulement 518 millions de paramètres, le modèle est nettement plus petit que les systèmes comparables, qui nécessitent souvent des dizaines de milliards de paramètres.
Réponse rapide : la génération d’un son de haute qualité pour un clip vidéo de 9 secondes ne prend que 0,63 seconde, ce qui se rapproche des performances en temps réel.
Perspective du secteur : l’essor de l’audio ambiant authentique
Le lancement de PrismAudio offre non seulement un outil d’automatisation robuste pour la post-production cinématographique et la création de vidéos courtes, mais il inspire également de nouvelles approches en matière de génération multi-objets. À mesure que l’IA améliore sa capacité à équilibrer la texture audio et le positionnement spatial, la production vidéo future atteindra de plus en plus une véritable fidélité selon le principe « ce que vous voyez est ce que vous entendez ».
Lien vers l'article : arXiv:2511.18833
Lien vers le code open source : https://prismaudio-project.github.io/
Yushu Technology, première action de robots humanoïdes cotée sur le marché A, fixe son introduction en bourse au 19 août avec une valorisation d’environ 61 milliards de yuans
Prévue pour être cotée sur le tableau de l'innovation scientifique et technologique le 19 août, Yue Shu Technology fera ses débuts à 150,80 yuans par action, établissant une capitalisation boursière post-émission d'environ 60,993 milliards de yuans.
Le nœud Ali Zhenwu M890 Ultra est désormais compatible avec Qwen3.8, disponible sur la plateforme BaiLian pour l'inférence.
Alibaba Cloud a confirmé le 23 juillet que son super nœud Zhenwu M890 s’est intégré avec succès au dernier modèle d’IA de grande envergure phare, Qwen3.8, le rendant disponible pour les services d’inférence de modèles sur la plateforme Alibaba Cloud











