option
Maison
Flash info
Contenu
MatthewLewis
MatthewLewis
21 juillet 2026

Google DeepMind a lancé GenCeption, un modèle basé sur le framework Wan2.1 d’Alibaba qui transforme la génération de vidéos en un moteur d’analyse visuelle. Il effectue simultanément cinq tâches principales, notamment l’estimation de la profondeur, la segmentation et l’estimation de la pose 3D, en un seul passage direct. Entraîné uniquement sur 7 500 vidéos synthétiques mettant en scène une seule personne, il s'adapte aux scènes comportant plusieurs personnes, des animaux et des robots. Le petit modèle traite 81 images en 6 secondes ; le grand modèle de 14 milliards de paramètres prend 10 secondes, tout en conservant les détails fins tels que les moustaches et les poils d'un chat.

Google DeepMind a lancé GenCeption, un modèle basé sur le framework Wan2.1 d’Alibaba qui transforme la génération de vidéos en un moteur d’analyse visuelle. Il effectue simultanément cinq tâches principales, notamment l’estimation de la profondeur, la segmentation et l’estimation de la pose 3D, en un seul passage direct. Entraîné uniquement sur 7 500 vidéos synthétiques mettant en scène une seule personne, il s'adapte aux scènes comportant plusieurs personnes, des animaux et des robots. Le petit modèle traite 81 images en 6 secondes ; le grand modèle de 14 milliards de paramètres prend 10 secondes, tout en conservant les détails fins tels que les moustaches et les poils d'un chat.
commentaires (0)
0/300
OR