Hogar
Tongyi, de Alibaba, presenta Fun-CineForge: un modelo de IA de código abierto que logra una síntesis de voz con calidad cinematográfica
El 16 de marzo, Alibaba Tongyi Lab presentó oficialmente y puso a disposición como código abierto el modelo multimodal de síntesis de voz para múltiples escenarios y con calidad cinematográfica Fun-CineForge. Este modelo aborda los principales retos del doblaje con IA, entre los que se incluyen la falta de sincronización labial, la falta de expresión emocional y las características vocales inconsistentes entre los distintos personajes. Además, introduce un método de alta calidad para la construcción de conjuntos de datos.

Técnicamente, Fun-CineForge es pionero en el concepto de «modalidad temporal». A diferencia de los modelos convencionales que se centran únicamente en el texto o las imágenes, garantiza que la síntesis de voz se produzca en intervalos de tiempo precisos mediante un control exacto de las marcas de tiempo. Incluso en escenas cinematográficas complejas con personajes ocultos, cortes frecuentes de cámara o rostros borrosos, el modelo mantiene un alto grado de sincronización audiovisual y de cumplimiento de las instrucciones.
El canal de construcción del conjunto de datos de código abierto CineDub que lo acompaña es otra innovación clave. Tongyi Lab empleó el razonamiento de cadena de pensamiento de los grandes modelos de lenguaje para transformar automáticamente el metraje cinematográfico sin procesar en datos estructurados, lo que redujo significativamente la necesidad de anotación manual. Este proceso alcanza una tasa de error de palabras de aproximadamente el 1 % y una tasa de error de diarización de hablantes de solo el 1,20 %, lo que proporciona una base de entrenamiento altamente competitiva para modelos de gran tamaño.

Fun-CineForge ya está disponible en GitHub, HuggingFace y la comunidad ModelScope, y admite la inferencia de clips de vídeo de hasta 30 segundos de duración. Destaca no solo en monólogos de un solo hablante, sino que también ofrece soporte de nivel profesional para escenarios de diálogo a dúo y con varios hablantes. Este avance marca la evolución de la tecnología de voz de IA, pasando de funciones básicas de atención al cliente y asistencia a la postproducción de animación y cine de alto nivel.
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
Artículo relacionado
El primer modelo de SSI de Ilya, ex científico jefe de OpenAI, se presenta
La inteligencia artificial ha alcanzado otro hito importante. Tras su salida de OpenAI, el ex científico jefe Ilya Sutskever fundó Safe Superintelligence Inc. (SSI), que ha revelado recientemente detalles sobre su modelo inaugural. Informes de redes
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
El 14 de mayo de 2026, la plataforma de desarrollo de aplicaciones de IA Lovable anunció su participación en la ronda de financiación semilla de 800.000 dólares para la startup danesa de hardware Atech. Liderada por Lovable, la ronda atrajo a firmas
Anthropic amplía las herramientas de codificación de Claude AI a Japón en su impulso por el crecimiento en el extranjero
Anthropic, una destacada empresa estadounidense de inteligencia artificial, está intensificando su alcance global. El miércoles, la compañía organizó una importante reunión de desarrolladores, "Code with Claude", en Tokio, que reunió a cerca de 500 i
Recomendaciones de temas especiales relacionados
comentario (1)
0/500
Just tried the demo and honestly blown away by how natural the lip-sync feels now! 😮 Always thought AI dubbing sounded a bit robotic, but this seems like a huge leap. Wonder if this will start being used in indie films or even gaming soon? The open-source move is pretty bold too—curious to see how other companies respond.
El 16 de marzo, Alibaba Tongyi Lab presentó oficialmente y puso a disposición como código abierto el modelo multimodal de síntesis de voz para múltiples escenarios y con calidad cinematográfica Fun-CineForge. Este modelo aborda los principales retos del doblaje con IA, entre los que se incluyen la falta de sincronización labial, la falta de expresión emocional y las características vocales inconsistentes entre los distintos personajes. Además, introduce un método de alta calidad para la construcción de conjuntos de datos.

Técnicamente, Fun-CineForge es pionero en el concepto de «modalidad temporal». A diferencia de los modelos convencionales que se centran únicamente en el texto o las imágenes, garantiza que la síntesis de voz se produzca en intervalos de tiempo precisos mediante un control exacto de las marcas de tiempo. Incluso en escenas cinematográficas complejas con personajes ocultos, cortes frecuentes de cámara o rostros borrosos, el modelo mantiene un alto grado de sincronización audiovisual y de cumplimiento de las instrucciones.
El canal de construcción del conjunto de datos de código abierto CineDub que lo acompaña es otra innovación clave. Tongyi Lab empleó el razonamiento de cadena de pensamiento de los grandes modelos de lenguaje para transformar automáticamente el metraje cinematográfico sin procesar en datos estructurados, lo que redujo significativamente la necesidad de anotación manual. Este proceso alcanza una tasa de error de palabras de aproximadamente el 1 % y una tasa de error de diarización de hablantes de solo el 1,20 %, lo que proporciona una base de entrenamiento altamente competitiva para modelos de gran tamaño.

Fun-CineForge ya está disponible en GitHub, HuggingFace y la comunidad ModelScope, y admite la inferencia de clips de vídeo de hasta 30 segundos de duración. Destaca no solo en monólogos de un solo hablante, sino que también ofrece soporte de nivel profesional para escenarios de diálogo a dúo y con varios hablantes. Este avance marca la evolución de la tecnología de voz de IA, pasando de funciones básicas de atención al cliente y asistencia a la postproducción de animación y cine de alto nivel.
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
El primer modelo de SSI de Ilya, ex científico jefe de OpenAI, se presenta
La inteligencia artificial ha alcanzado otro hito importante. Tras su salida de OpenAI, el ex científico jefe Ilya Sutskever fundó Safe Superintelligence Inc. (SSI), que ha revelado recientemente detalles sobre su modelo inaugural. Informes de redes
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
El 14 de mayo de 2026, la plataforma de desarrollo de aplicaciones de IA Lovable anunció su participación en la ronda de financiación semilla de 800.000 dólares para la startup danesa de hardware Atech. Liderada por Lovable, la ronda atrajo a firmas
Anthropic amplía las herramientas de codificación de Claude AI a Japón en su impulso por el crecimiento en el extranjero
Anthropic, una destacada empresa estadounidense de inteligencia artificial, está intensificando su alcance global. El miércoles, la compañía organizó una importante reunión de desarrolladores, "Code with Claude", en Tokio, que reunió a cerca de 500 i
Just tried the demo and honestly blown away by how natural the lip-sync feels now! 😮 Always thought AI dubbing sounded a bit robotic, but this seems like a huge leap. Wonder if this will start being used in indie films or even gaming soon? The open-source move is pretty bold too—curious to see how other companies respond.











