Option
Heim
Eilmeldung
Inhalt
MatthewLewis
MatthewLewis
21. Juli 2026

Google DeepMind hat GenCeption vorgestellt, ein Modell, das auf dem Wan2.1-Framework von Alibaba basiert und die Videogenerierung in eine visuelle Analyse-Engine umkehrt. Es führt fünf Kernaufgaben gleichzeitig aus, darunter Tiefenschätzung, Segmentierung und 3D-Posenabschätzung, und zwar in einem einzigen Vorwärtsdurchlauf. Obwohl es nur mit 7.500 synthetischen Videos mit einer einzigen Person trainiert wurde, lässt es sich auf Szenen mit mehreren Personen, Tieren und Robotern verallgemeinern. Das kleine Modell verarbeitet 81 Bilder in 6 Sekunden; das große 14-Milliarden-Modell benötigt 10 Sekunden und bewahrt dabei feine Details wie Katzenbart und Fell.

Google DeepMind hat GenCeption vorgestellt, ein Modell, das auf dem Wan2.1-Framework von Alibaba basiert und die Videogenerierung in eine visuelle Analyse-Engine umkehrt. Es führt fünf Kernaufgaben gleichzeitig aus, darunter Tiefenschätzung, Segmentierung und 3D-Posenabschätzung, und zwar in einem einzigen Vorwärtsdurchlauf. Obwohl es nur mit 7.500 synthetischen Videos mit einer einzigen Person trainiert wurde, lässt es sich auf Szenen mit mehreren Personen, Tieren und Robotern verallgemeinern. Das kleine Modell verarbeitet 81 Bilder in 6 Sekunden; das große 14-Milliarden-Modell benötigt 10 Sekunden und bewahrt dabei feine Details wie Katzenbart und Fell.
Kommentare (0)
0/300
OR