Hogar
Black Forest Labs presenta Flux3: el primer modelo multimodal nativo capaz de generar contenido audiovisual en 20 segundos
Black Forest Labs, una startup alemana especializada en inteligencia artificial, ha lanzado Flux3, un modelo base multimodal basado en la arquitectura Self-Flow. Integra códecs específicos para imagen, vídeo, audio y movimiento, lo que permite una comprensión y generación unificadas tanto de entornos físicos como digitales.
La característica más destacada de Flux3 es la sincronización nativa de audio y vídeo. Al ser el primer modelo multimodal que admite la generación directa de audio, produce clips sincronizados de hasta 20 segundos de duración. El modelo gestiona la conversión de texto a imagen, de imagen a vídeo, transiciones basadas en fotogramas clave y diálogos entre varios personajes, fusionando capacidades visuales y auditivas en una única base.

Las primeras pruebas comparativas muestran que Flux3 supera a sus competidores. A una resolución de 720p con clips de 10 segundos, alcanzó una tasa de acierto del 93 % frente a Luma Ray 3.2 y una ventaja del 77 % sobre Runway Gen-4.5, al tiempo que mantuvo una ligera ventaja sobre modelos de primer nivel como Seedance 2.0 y Gemini Omni Flash.
Black Forest Labs también ha ampliado estas capacidades a la robótica a través de Flux-mimic, desarrollado en colaboración con Mimic Robotics. Este modelo, que actualmente se encuentra en fase de pruebas de producción en una fábrica de Audi, demuestra el paso de la IA multimodal de las pantallas a las aplicaciones industriales. En cuanto a la disponibilidad, Flux3Video ya está operativo, y está previsto que Flux3Image y los pesos de código abierto «Flux3Dev» se lancen próximamente.
Artículo relacionado
WeChat presenta un cupo de 1.000 millones de tokens para la generación de imágenes mediante IA, gratuito para los usuarios
Tencent Cloud Development ha presentado hoy una importante actualización que acelera de forma significativa el «Plan de Crecimiento de los miniprogramas de IA de WeChat». Para garantizar que las ideas
Microsoft confirma la actualización de Windows 11 para 2026: vuelve la barra de tareas y la IA activa la «desintoxicación digital»
Tras años de sobrecarga del sistema y una reputación controvertida, Microsoft ha decidido finalmente llevar a cabo una «cirugía a gran escala» en Windows 11. Pavan Davuluri, responsable de Microsoft W
Google lanza las herramientas jurídicas Gemini Enterprise para bufetes de abogados
El martes, Google amplió su plataforma Gemini Enterprise con la presentación de Gemini Enterprise for Legal, una solución específica para abogados y bufetes, lo que supone una escalada significativa e
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Black Forest Labs, una startup alemana especializada en inteligencia artificial, ha lanzado Flux3, un modelo base multimodal basado en la arquitectura Self-Flow. Integra códecs específicos para imagen, vídeo, audio y movimiento, lo que permite una comprensión y generación unificadas tanto de entornos físicos como digitales.
La característica más destacada de Flux3 es la sincronización nativa de audio y vídeo. Al ser el primer modelo multimodal que admite la generación directa de audio, produce clips sincronizados de hasta 20 segundos de duración. El modelo gestiona la conversión de texto a imagen, de imagen a vídeo, transiciones basadas en fotogramas clave y diálogos entre varios personajes, fusionando capacidades visuales y auditivas en una única base.

Las primeras pruebas comparativas muestran que Flux3 supera a sus competidores. A una resolución de 720p con clips de 10 segundos, alcanzó una tasa de acierto del 93 % frente a Luma Ray 3.2 y una ventaja del 77 % sobre Runway Gen-4.5, al tiempo que mantuvo una ligera ventaja sobre modelos de primer nivel como Seedance 2.0 y Gemini Omni Flash.
Black Forest Labs también ha ampliado estas capacidades a la robótica a través de Flux-mimic, desarrollado en colaboración con Mimic Robotics. Este modelo, que actualmente se encuentra en fase de pruebas de producción en una fábrica de Audi, demuestra el paso de la IA multimodal de las pantallas a las aplicaciones industriales. En cuanto a la disponibilidad, Flux3Video ya está operativo, y está previsto que Flux3Image y los pesos de código abierto «Flux3Dev» se lancen próximamente.
WeChat presenta un cupo de 1.000 millones de tokens para la generación de imágenes mediante IA, gratuito para los usuarios
Tencent Cloud Development ha presentado hoy una importante actualización que acelera de forma significativa el «Plan de Crecimiento de los miniprogramas de IA de WeChat». Para garantizar que las ideas
Microsoft confirma la actualización de Windows 11 para 2026: vuelve la barra de tareas y la IA activa la «desintoxicación digital»
Tras años de sobrecarga del sistema y una reputación controvertida, Microsoft ha decidido finalmente llevar a cabo una «cirugía a gran escala» en Windows 11. Pavan Davuluri, responsable de Microsoft W
Google lanza las herramientas jurídicas Gemini Enterprise para bufetes de abogados
El martes, Google amplió su plataforma Gemini Enterprise con la presentación de Gemini Enterprise for Legal, una solución específica para abogados y bufetes, lo que supone una escalada significativa e











