Hogar
Google y NVIDIA publican el código fuente de DiffusionGemma, lo que multiplica por cuatro la velocidad de inferencia con una sola tarjeta
El 10 de junio de 2026, Google lanzó DiffusionGemma, un modelo de lenguaje experimental de código abierto que rompe con el paradigma autorregresivo tradicional de generar texto palabra a palabra. Es pionero en el uso de mecanismos de difusión procedentes de la IA aplicada a las imágenes en la generación de texto, partiendo de ruido aleatorio y refinándolo de forma iterativa para generar bloques de 256 tokens en paralelo en cada paso.

En cuanto al rendimiento del hardware, las profundas optimizaciones de NVIDIA permiten que el modelo funcione casi cuatro veces más rápido que los modelos tradicionales comparables en modo de un solo usuario con una sola GPU. En una GPU H100, alcanza velocidades de salida de hasta 1.000 tokens por segundo para una sola solicitud, e incluso en GPU de consumo de gama alta como la RTX 5090 puede superar los 700 tokens por segundo.
DiffusionGemma cuenta con 26 000 millones de parámetros y utiliza una arquitectura de «mezcla de expertos» (MoE), activando solo 3 800 millones de parámetros por paso. Aunque la calidad y precisión de su generación de texto quedan ligeramente por detrás de los modelos tradicionales de la serie Gemma4 en las pruebas de rendimiento estándar, su exclusiva «conciencia de bloque completo» supera la limitación de los modelos autorregresivos, que solo funcionan hacia atrás. Dado que todos los tokens pueden hacer referencia entre sí durante la generación, destaca en tareas que implican datos no lineales y estructurados, como la finalización de textos, el rellenado de código, la resolución de sudokus y el procesamiento de secuencias de aminoácidos.

Los pesos del modelo son ahora de código abierto en Hugging Face bajo la licencia Apache 2.0 y funcionan a la perfección con marcos de inferencia habituales como vLLM y MLX. Esta investigación no solo elimina las restricciones de ancho de banda de memoria en la potencia de cálculo de la GPU, sino que también abre una nueva vía técnica para futuras aplicaciones de IA en lógica compleja y generación de texto no lineal.
Artículo relacionado
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas
Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
El 10 de junio de 2026, Google lanzó DiffusionGemma, un modelo de lenguaje experimental de código abierto que rompe con el paradigma autorregresivo tradicional de generar texto palabra a palabra. Es pionero en el uso de mecanismos de difusión procedentes de la IA aplicada a las imágenes en la generación de texto, partiendo de ruido aleatorio y refinándolo de forma iterativa para generar bloques de 256 tokens en paralelo en cada paso.

En cuanto al rendimiento del hardware, las profundas optimizaciones de NVIDIA permiten que el modelo funcione casi cuatro veces más rápido que los modelos tradicionales comparables en modo de un solo usuario con una sola GPU. En una GPU H100, alcanza velocidades de salida de hasta 1.000 tokens por segundo para una sola solicitud, e incluso en GPU de consumo de gama alta como la RTX 5090 puede superar los 700 tokens por segundo.
DiffusionGemma cuenta con 26 000 millones de parámetros y utiliza una arquitectura de «mezcla de expertos» (MoE), activando solo 3 800 millones de parámetros por paso. Aunque la calidad y precisión de su generación de texto quedan ligeramente por detrás de los modelos tradicionales de la serie Gemma4 en las pruebas de rendimiento estándar, su exclusiva «conciencia de bloque completo» supera la limitación de los modelos autorregresivos, que solo funcionan hacia atrás. Dado que todos los tokens pueden hacer referencia entre sí durante la generación, destaca en tareas que implican datos no lineales y estructurados, como la finalización de textos, el rellenado de código, la resolución de sudokus y el procesamiento de secuencias de aminoácidos.

Los pesos del modelo son ahora de código abierto en Hugging Face bajo la licencia Apache 2.0 y funcionan a la perfección con marcos de inferencia habituales como vLLM y MLX. Esta investigación no solo elimina las restricciones de ancho de banda de memoria en la potencia de cálculo de la GPU, sino que también abre una nueva vía técnica para futuras aplicaciones de IA en lógica compleja y generación de texto no lineal.
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en











