Tongyi Lab presenta PrismAudio para la separación audiovisual bidireccional
En una época en la que la generación de vídeo mediante IA está experimentando un rápido crecimiento, la falta de sincronización entre la imagen y el audio —que a menudo se manifiesta en forma de silencio o de desajuste entre ambos— sigue siendo un obstáculo importante para la inmersión del espectador. Para hacer frente a este reto, el Tongyi Lab de Alibaba ha presentado PrismAudio, un novedoso marco de trabajo de vídeo a audio. Esta investigación, aceptada en la prestigiosa conferencia sobre IA ICLR 2026, se centra en la sincronización automática de contenidos de vídeo con efectos de sonido ambiental precisos.

Razonamiento previo a la generación: dominar el audio con la «cadena de pensamiento»
Los modelos convencionales de generación de audio suelen funcionar de forma «intuitiva», lo que a menudo produce resultados incongruentes —como que el cascarilleo de los cascos de un caballo suene como el gorjeo de un pájaro, o que el audio vaya por detrás de la acción visual—. PrismAudio se distingue por emplear un enfoque de «primero planificar, luego generar».
Cadena de pensamiento de descomposición: antes de generar el audio, el modelo analiza el vídeo fotograma a fotograma: identifica los elementos de la escena, determina el momento de inicio del sonido, evalúa las características del audio (por ejemplo, nitidez o profundidad) y localiza espacialmente la fuente sonora.
Evaluación multidimensional: Para garantizar un resultado de alta calidad, el equipo de desarrollo integró el aprendizaje por refuerzo, utilizando cuatro «evaluadores virtuales» para puntuar los resultados en cuanto a consistencia semántica, sincronización temporal, calidad estética y precisión espacial. Este ciclo de retroalimentación multifacético resuelve el problema habitual de que los modelos anteriores se optimizaban para un aspecto mientras descuidaban otros.
Ligero y eficiente: procesamiento de vídeos de 9 segundos en 0,6 segundos
Más allá de la precisión, PrismAudio ofrece una velocidad excepcional. Aprovechando su algoritmo de entrenamiento patentado Fast-GRPO, el modelo logra un aumento sustancial del rendimiento al tiempo que mantiene la eficiencia operativa:
Arquitectura compacta, gran impacto: con solo 518 millones de parámetros, el modelo es significativamente más pequeño que los sistemas comparables, que a menudo requieren decenas de miles de millones de parámetros.
Respuesta rápida: generar audio de alta calidad para un clip de vídeo de 9 segundos lleva apenas 0,63 segundos, lo que se acerca al rendimiento en tiempo real.
Perspectiva del sector: el auge del audio ambiental auténtico
El lanzamiento de PrismAudio no solo ofrece una sólida herramienta de automatización para la posproducción cinematográfica y la creación de vídeos de formato corto, sino que también inspira nuevos enfoques para la generación de múltiples objetos. A medida que la IA mejore su capacidad para equilibrar la textura del audio y el posicionamiento espacial, la producción de vídeo del futuro alcanzará cada vez más una fidelidad auténtica del tipo «lo que ves es lo que oyes».
Enlace al artículo: arXiv:2511.18833
Enlace al código abierto: https://prismaudio-project.github.io/
Artículo relacionado
Neros Technologies asegura 250 millones de dólares para desplegar drones de defensa para 2026
Neros Archer: Un dron FPV diseñado para cargas útiles modulares y enlaces de comunicación resistentes. | Fuente: NerosNeros Inc. ha cerrado una ronda de financiación Serie C por 250 millones de dólares, elevando la valoración del contratista de drone
Yushu Technology, la primera acción de robots humanoides en el mercado A, fija su cotización para el 19 de agosto con una valoración de aproximadamente 61 mil millones de yuanes
Programada para su cotización en la Junta de Innovación Científica y Tecnológica el 19 de agosto, Yue Shu Technology debutará a 150,80 yuanes por acción, estableciendo una capitalización bursátil post-emisión de aproximadamente 60.993 mil millones de
El nodo Ali Zhenwu M890 Ultra ya es compatible con Qwen3.8 y está disponible en la plataforma BaiLian para inferencia.
Alibaba Cloud confirmó el 23 de julio que su nodo super Zhenwu M890 se ha integrado con éxito con el último modelo grande insignia, Qwen3.8, poniéndolo a disposición para servicios de inferencia de modelos en la plataforma Alibaba Cloud BaiLian. Este
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
En una época en la que la generación de vídeo mediante IA está experimentando un rápido crecimiento, la falta de sincronización entre la imagen y el audio —que a menudo se manifiesta en forma de silencio o de desajuste entre ambos— sigue siendo un obstáculo importante para la inmersión del espectador. Para hacer frente a este reto, el Tongyi Lab de Alibaba ha presentado PrismAudio, un novedoso marco de trabajo de vídeo a audio. Esta investigación, aceptada en la prestigiosa conferencia sobre IA ICLR 2026, se centra en la sincronización automática de contenidos de vídeo con efectos de sonido ambiental precisos.

Razonamiento previo a la generación: dominar el audio con la «cadena de pensamiento»
Los modelos convencionales de generación de audio suelen funcionar de forma «intuitiva», lo que a menudo produce resultados incongruentes —como que el cascarilleo de los cascos de un caballo suene como el gorjeo de un pájaro, o que el audio vaya por detrás de la acción visual—. PrismAudio se distingue por emplear un enfoque de «primero planificar, luego generar».
Cadena de pensamiento de descomposición: antes de generar el audio, el modelo analiza el vídeo fotograma a fotograma: identifica los elementos de la escena, determina el momento de inicio del sonido, evalúa las características del audio (por ejemplo, nitidez o profundidad) y localiza espacialmente la fuente sonora.
Evaluación multidimensional: Para garantizar un resultado de alta calidad, el equipo de desarrollo integró el aprendizaje por refuerzo, utilizando cuatro «evaluadores virtuales» para puntuar los resultados en cuanto a consistencia semántica, sincronización temporal, calidad estética y precisión espacial. Este ciclo de retroalimentación multifacético resuelve el problema habitual de que los modelos anteriores se optimizaban para un aspecto mientras descuidaban otros.
Ligero y eficiente: procesamiento de vídeos de 9 segundos en 0,6 segundos
Más allá de la precisión, PrismAudio ofrece una velocidad excepcional. Aprovechando su algoritmo de entrenamiento patentado Fast-GRPO, el modelo logra un aumento sustancial del rendimiento al tiempo que mantiene la eficiencia operativa:
Arquitectura compacta, gran impacto: con solo 518 millones de parámetros, el modelo es significativamente más pequeño que los sistemas comparables, que a menudo requieren decenas de miles de millones de parámetros.
Respuesta rápida: generar audio de alta calidad para un clip de vídeo de 9 segundos lleva apenas 0,63 segundos, lo que se acerca al rendimiento en tiempo real.
Perspectiva del sector: el auge del audio ambiental auténtico
El lanzamiento de PrismAudio no solo ofrece una sólida herramienta de automatización para la posproducción cinematográfica y la creación de vídeos de formato corto, sino que también inspira nuevos enfoques para la generación de múltiples objetos. A medida que la IA mejore su capacidad para equilibrar la textura del audio y el posicionamiento espacial, la producción de vídeo del futuro alcanzará cada vez más una fidelidad auténtica del tipo «lo que ves es lo que oyes».
Enlace al artículo: arXiv:2511.18833
Enlace al código abierto: https://prismaudio-project.github.io/
Yushu Technology, la primera acción de robots humanoides en el mercado A, fija su cotización para el 19 de agosto con una valoración de aproximadamente 61 mil millones de yuanes
Programada para su cotización en la Junta de Innovación Científica y Tecnológica el 19 de agosto, Yue Shu Technology debutará a 150,80 yuanes por acción, estableciendo una capitalización bursátil post-emisión de aproximadamente 60.993 mil millones de
El nodo Ali Zhenwu M890 Ultra ya es compatible con Qwen3.8 y está disponible en la plataforma BaiLian para inferencia.
Alibaba Cloud confirmó el 23 de julio que su nodo super Zhenwu M890 se ha integrado con éxito con el último modelo grande insignia, Qwen3.8, poniéndolo a disposición para servicios de inferencia de modelos en la plataforma Alibaba Cloud BaiLian. Este





Hogar






