opción
Hogar
Última hora
Contenido
MatthewLewis
MatthewLewis
21 de julio de 2026

Google DeepMind ha lanzado GenCeption, un modelo basado en el marco Wan2.1 de Alibaba que transforma la generación de vídeo en un motor de análisis visual. Realiza cinco tareas fundamentales de forma simultánea, entre las que se incluyen la estimación de profundidad, la segmentación y la estimación de la pose 3D en una sola pasada. Entrenado únicamente con 7.500 vídeos sintéticos de una sola persona, es capaz de generalizar a escenas con varias personas, animales y robots. El modelo pequeño procesa 81 fotogramas en 6 segundos; el modelo grande, de 14.000 millones de parámetros, tarda 10 segundos, conservando detalles sutiles como los bigotes y el pelaje de un gato.

Google DeepMind ha lanzado GenCeption, un modelo basado en el marco Wan2.1 de Alibaba que transforma la generación de vídeo en un motor de análisis visual. Realiza cinco tareas fundamentales de forma simultánea, entre las que se incluyen la estimación de profundidad, la segmentación y la estimación de la pose 3D en una sola pasada. Entrenado únicamente con 7.500 vídeos sintéticos de una sola persona, es capaz de generalizar a escenas con varias personas, animales y robots. El modelo pequeño procesa 81 fotogramas en 6 segundos; el modelo grande, de 14.000 millones de parámetros, tarda 10 segundos, conservando detalles sutiles como los bigotes y el pelaje de un gato.
comentario (0)
0/300
OR