opção
MatthewLewis
MatthewLewis
21 de Julho de 2026

O Google DeepMind lançou o GenCeption, um modelo desenvolvido com base na estrutura Wan2.1 do Alibaba que transforma a geração de vídeos em um mecanismo de análise visual. Ele realiza cinco tarefas principais simultaneamente, incluindo estimativa de profundidade, segmentação e estimativa de pose 3D em uma única passagem direta. Treinado com apenas 7.500 vídeos sintéticos de uma única pessoa, ele se generaliza para cenas com várias pessoas, animais e robôs. O modelo pequeno processa 81 quadros em 6 segundos; o modelo grande, de 14 bilhões, leva 10 segundos, preservando detalhes finos como bigodes e pelos de gatos.

O Google DeepMind lançou o GenCeption, um modelo desenvolvido com base na estrutura Wan2.1 do Alibaba que transforma a geração de vídeos em um mecanismo de análise visual. Ele realiza cinco tarefas principais simultaneamente, incluindo estimativa de profundidade, segmentação e estimativa de pose 3D em uma única passagem direta. Treinado com apenas 7.500 vídeos sintéticos de uma única pessoa, ele se generaliza para cenas com várias pessoas, animais e robôs. O modelo pequeno processa 81 quadros em 6 segundos; o modelo grande, de 14 bilhões, leva 10 segundos, preservando detalhes finos como bigodes e pelos de gatos.
Comentários (0)
0/300
OR