Heim
Black Forest Labs stellt Flux3 vor: das erste native multimodale Modell zur Erzeugung von audiovisuellen Inhalten in 20 Sekunden
Black Forest Labs, ein deutsches KI-Start-up, hat Flux3 vorgestellt, ein multimodales Grundmodell, das auf der Self-Flow-Architektur basiert. Es integriert spezielle Codecs für Bild, Video, Audio und Bewegung und ermöglicht so ein einheitliches Verständnis sowie die Generierung sowohl physischer als auch digitaler Umgebungen.
Das herausragende Merkmal von Flux3 ist die native Audio-Video-Synchronisation. Als erstes multimodales Modell, das die direkte Audiogenerierung unterstützt, erzeugt es synchronisierte Clips mit einer Länge von bis zu 20 Sekunden. Das Modell beherrscht Text-zu-Bild, Bild-zu-Video, Keyframe-basierte Übergänge und Dialoge mit mehreren Charakteren und vereint dabei visuelle und auditive Fähigkeiten in einer einzigen Basis.

Erste Benchmarks zeigen, dass Flux3 die Konkurrenz übertrifft. Bei einer Auflösung von 720p und 10-Sekunden-Clips erzielte es eine Gewinnquote von 93 % gegenüber Luma Ray 3.2 und einen Vorsprung von 77 % gegenüber Runway Gen-4.5, während es gleichzeitig einen leichten Vorsprung gegenüber Spitzenmodellen wie Seedance 2.0 und Gemini Omni Flash behielt.
Black Forest Labs hat diese Fähigkeiten durch „Flux-mimic“, das in Zusammenarbeit mit Mimic Robotics entwickelt wurde, auch auf die Robotik ausgeweitet. Dieses Modell, das derzeit in einem Audi-Werk Produktionstests durchläuft, verdeutlicht den Wandel der multimodalen KI von Bildschirmen hin zu industriellen Anwendungen. Was die Verfügbarkeit betrifft, so ist Flux3Video bereits live, während Flux3Image und die Open-Source-Gewichte „Flux3Dev“ in Kürze veröffentlicht werden sollen.
Verwandter Artikel
WeChat kündigt ein Kontingent von 1 Milliarde Token für die KI-Bildgenerierung an – für Nutzer kostenlos
Tencent Cloud Development hat heute ein umfangreiches Update vorgestellt, das den „WeChat AI Mini Program Growth Plan“ erheblich beschleunigt. Um sicherzustellen, dass die innovativen Ideen der Entwic
Microsoft bestätigt Windows 11-Update für 2026: Die Taskleiste kehrt zurück, KI ermöglicht „Digital Detox“
Nach Jahren der Systemaufblähung und einem umstrittenen Ruf hat Microsoft nun endlich beschlossen, Windows 11 einer „großen Operation“ zu unterziehen. Pavan Davuluri, Leiter von Microsoft Windows, bes
Google bringt „Gemini Enterprise Legal Tools“ für Anwaltskanzleien auf den Markt
Am Dienstag erweiterte Google seine „Gemini Enterprise“-Plattform um „Gemini Enterprise for Legal“, eine spezielle Lösung für Rechtsanwälte und Anwaltskanzleien, was eine deutliche Verschärfung des We
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
Black Forest Labs, ein deutsches KI-Start-up, hat Flux3 vorgestellt, ein multimodales Grundmodell, das auf der Self-Flow-Architektur basiert. Es integriert spezielle Codecs für Bild, Video, Audio und Bewegung und ermöglicht so ein einheitliches Verständnis sowie die Generierung sowohl physischer als auch digitaler Umgebungen.
Das herausragende Merkmal von Flux3 ist die native Audio-Video-Synchronisation. Als erstes multimodales Modell, das die direkte Audiogenerierung unterstützt, erzeugt es synchronisierte Clips mit einer Länge von bis zu 20 Sekunden. Das Modell beherrscht Text-zu-Bild, Bild-zu-Video, Keyframe-basierte Übergänge und Dialoge mit mehreren Charakteren und vereint dabei visuelle und auditive Fähigkeiten in einer einzigen Basis.

Erste Benchmarks zeigen, dass Flux3 die Konkurrenz übertrifft. Bei einer Auflösung von 720p und 10-Sekunden-Clips erzielte es eine Gewinnquote von 93 % gegenüber Luma Ray 3.2 und einen Vorsprung von 77 % gegenüber Runway Gen-4.5, während es gleichzeitig einen leichten Vorsprung gegenüber Spitzenmodellen wie Seedance 2.0 und Gemini Omni Flash behielt.
Black Forest Labs hat diese Fähigkeiten durch „Flux-mimic“, das in Zusammenarbeit mit Mimic Robotics entwickelt wurde, auch auf die Robotik ausgeweitet. Dieses Modell, das derzeit in einem Audi-Werk Produktionstests durchläuft, verdeutlicht den Wandel der multimodalen KI von Bildschirmen hin zu industriellen Anwendungen. Was die Verfügbarkeit betrifft, so ist Flux3Video bereits live, während Flux3Image und die Open-Source-Gewichte „Flux3Dev“ in Kürze veröffentlicht werden sollen.
WeChat kündigt ein Kontingent von 1 Milliarde Token für die KI-Bildgenerierung an – für Nutzer kostenlos
Tencent Cloud Development hat heute ein umfangreiches Update vorgestellt, das den „WeChat AI Mini Program Growth Plan“ erheblich beschleunigt. Um sicherzustellen, dass die innovativen Ideen der Entwic
Microsoft bestätigt Windows 11-Update für 2026: Die Taskleiste kehrt zurück, KI ermöglicht „Digital Detox“
Nach Jahren der Systemaufblähung und einem umstrittenen Ruf hat Microsoft nun endlich beschlossen, Windows 11 einer „großen Operation“ zu unterziehen. Pavan Davuluri, Leiter von Microsoft Windows, bes
Google bringt „Gemini Enterprise Legal Tools“ für Anwaltskanzleien auf den Markt
Am Dienstag erweiterte Google seine „Gemini Enterprise“-Plattform um „Gemini Enterprise for Legal“, eine spezielle Lösung für Rechtsanwälte und Anwaltskanzleien, was eine deutliche Verschärfung des We











