Hogar
Google Gemma4 alcanza tres veces la velocidad anterior, marcando el verdadero inicio de la era de los grandes modelos sin conexión a Internet.

Solo unas semanas después de causar un gran revuelo en el campo de los modelos open-source, Google ha mejorado significativamente una vez más su modelo open-source más potente, Gemma4. El 5 de mayo, hora local, Google lanzó oficialmente un generador de borradores para predicciones multi-token (MTP) para la serie Gemma4. Este avance tecnológico utiliza una arquitectura de decodificación especulativa para aumentar la velocidad de razonamiento del modelo hasta en tres veces sin sacrificar la calidad de la salida ni las capacidades lógicas.
Como uno de los modelos open-source más seguidos a nivel mundial, Gemma4 ya ha recibido más de 60 millones de descargas desde su lanzamiento. El objetivo principal de esta actualización es abordar el persistente cuello de botella en el razonamiento de los grandes modelos de lenguaje y optimizar aún más la eficiencia computacional.
Desglose técnico: Alcanzar la “previsión” en la aceleración del razonamiento
El razonamiento tradicional de los modelos de lenguaje a menudo está restringido por el ancho de banda de memoria. En términos simples, cuando el procesador genera texto, mover cientos de miles de millones de parámetros de la memoria a la unidad de cómputo consume mucho tiempo. Esta velocidad de transferencia de datos es mucho más lenta que la velocidad de procesamiento, lo que deja los recursos hardware inactivos la mayor parte del tiempo y causa retrasos notables en la respuesta.
Para abordar este problema, Google introdujo la decodificación especulativa. Su principio se puede entender como una configuración “maestro-esclavo”: el sistema empareja modelos objetivo pesados, como Gemma 4 31B, con generadores de borradores MTP ligeros. El generador utiliza recursos computacionales inactivos para predecir varios tokens futuros de antemano, mientras que el modelo principal más potente realiza verificaciones en paralelo. Cuando las predicciones coinciden, el modelo puede confirmar toda la secuencia en un solo cálculo, reduciendo significativamente el tiempo necesario para generar texto.
Resultados de pruebas: El Apple Silicon y las tarjetas gráficas de consumo logran grandes mejoras
Según datos oficiales de pruebas, el efecto de aceleración es especialmente notable en dispositivos locales. En entornos con Apple Silicon, con tamaños de lote entre 4 y 8, la velocidad de inferencia local del modelo Gemma 4 26B aumentó aproximadamente en 2.2 veces.
Esto significa que los desarrolladores ahora pueden ejecutar asistentes de programación offline complejos o flujos de trabajo de agentes inteligentes de manera más fluida en computadoras personales y tarjetas gráficas de consumo estándar. Además, la mejora en la eficiencia de inferencia también ha reducido significativamente el consumo de energía en dispositivos periféricos, allanando el camino para una mayor adopción del AI móvil.
Los límites de las aplicaciones de IA continúan expandiéndose
Esta actualización técnica se dirige principalmente a escenarios con requisitos estrictos de baja latencia, como chatbots en tiempo real, herramientas de programación automatizadas y varios agentes autónomos. Con el generador MTP, Google ha demostrado que incluso en entornos hardware con recursos limitados, los desarrolladores pueden implementar modelos de lenguaje de vanguardia sin comprometer la velocidad de respuesta ni la precisión computacional.
A medida que el costo y las barreras para la inferencia continúan disminuyendo, la evolución de Gemma4 y sus tecnologías asociadas está llevando al AI desde la nube hacia una gama más amplia de dispositivos de cómputo personal.
Artículo relacionado
Las gafas inteligentes de Apple podrían debutar en la WWDC27, destacando la protección de la privacidad
El informe de Mark Gurman de Bloomberg indica que las gafas inteligentes de Apple, con el nombre en código N50, están previstas para su presentación en la WWDC27 de junio de 2027, con un lanzamiento al público previsto para el otoño de 2027. Original
Dentro de los detalles revelados sobre el Gemini de próxima generación: Potencia de cálculo limitada, los equipos internos discreparon sobre las prioridades de desarrollo y la asignación de recursos
Los informes indican que el lanzamiento del tan esperado modelo Gemini de próxima generación de Google ha sido pospuesto. Los desacuerdos internos sobre las prioridades de desarrollo y la asignación de recursos, combinados con una capacidad de comput
OpenAI descarta preocupaciones por la desaceleración del crecimiento y afirma que múltiples unidades de negocio están acelerando
En respuesta a la escrutinio externo sobre el desaceleramiento del crecimiento de las ventas y el incumplimiento de las metas internas, el líder en inteligencia artificial, OpenAI, emitió una declaración contundente el martes 28 de abril. La empresa
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

Solo unas semanas después de causar un gran revuelo en el campo de los modelos open-source, Google ha mejorado significativamente una vez más su modelo open-source más potente, Gemma4. El 5 de mayo, hora local, Google lanzó oficialmente un generador de borradores para predicciones multi-token (MTP) para la serie Gemma4. Este avance tecnológico utiliza una arquitectura de decodificación especulativa para aumentar la velocidad de razonamiento del modelo hasta en tres veces sin sacrificar la calidad de la salida ni las capacidades lógicas.
Como uno de los modelos open-source más seguidos a nivel mundial, Gemma4 ya ha recibido más de 60 millones de descargas desde su lanzamiento. El objetivo principal de esta actualización es abordar el persistente cuello de botella en el razonamiento de los grandes modelos de lenguaje y optimizar aún más la eficiencia computacional.
Desglose técnico: Alcanzar la “previsión” en la aceleración del razonamiento
El razonamiento tradicional de los modelos de lenguaje a menudo está restringido por el ancho de banda de memoria. En términos simples, cuando el procesador genera texto, mover cientos de miles de millones de parámetros de la memoria a la unidad de cómputo consume mucho tiempo. Esta velocidad de transferencia de datos es mucho más lenta que la velocidad de procesamiento, lo que deja los recursos hardware inactivos la mayor parte del tiempo y causa retrasos notables en la respuesta.
Para abordar este problema, Google introdujo la decodificación especulativa. Su principio se puede entender como una configuración “maestro-esclavo”: el sistema empareja modelos objetivo pesados, como Gemma 4 31B, con generadores de borradores MTP ligeros. El generador utiliza recursos computacionales inactivos para predecir varios tokens futuros de antemano, mientras que el modelo principal más potente realiza verificaciones en paralelo. Cuando las predicciones coinciden, el modelo puede confirmar toda la secuencia en un solo cálculo, reduciendo significativamente el tiempo necesario para generar texto.
Resultados de pruebas: El Apple Silicon y las tarjetas gráficas de consumo logran grandes mejoras
Según datos oficiales de pruebas, el efecto de aceleración es especialmente notable en dispositivos locales. En entornos con Apple Silicon, con tamaños de lote entre 4 y 8, la velocidad de inferencia local del modelo Gemma 4 26B aumentó aproximadamente en 2.2 veces.
Esto significa que los desarrolladores ahora pueden ejecutar asistentes de programación offline complejos o flujos de trabajo de agentes inteligentes de manera más fluida en computadoras personales y tarjetas gráficas de consumo estándar. Además, la mejora en la eficiencia de inferencia también ha reducido significativamente el consumo de energía en dispositivos periféricos, allanando el camino para una mayor adopción del AI móvil.
Los límites de las aplicaciones de IA continúan expandiéndose
Esta actualización técnica se dirige principalmente a escenarios con requisitos estrictos de baja latencia, como chatbots en tiempo real, herramientas de programación automatizadas y varios agentes autónomos. Con el generador MTP, Google ha demostrado que incluso en entornos hardware con recursos limitados, los desarrolladores pueden implementar modelos de lenguaje de vanguardia sin comprometer la velocidad de respuesta ni la precisión computacional.
A medida que el costo y las barreras para la inferencia continúan disminuyendo, la evolución de Gemma4 y sus tecnologías asociadas está llevando al AI desde la nube hacia una gama más amplia de dispositivos de cómputo personal.
Las gafas inteligentes de Apple podrían debutar en la WWDC27, destacando la protección de la privacidad
El informe de Mark Gurman de Bloomberg indica que las gafas inteligentes de Apple, con el nombre en código N50, están previstas para su presentación en la WWDC27 de junio de 2027, con un lanzamiento al público previsto para el otoño de 2027. Original
Dentro de los detalles revelados sobre el Gemini de próxima generación: Potencia de cálculo limitada, los equipos internos discreparon sobre las prioridades de desarrollo y la asignación de recursos
Los informes indican que el lanzamiento del tan esperado modelo Gemini de próxima generación de Google ha sido pospuesto. Los desacuerdos internos sobre las prioridades de desarrollo y la asignación de recursos, combinados con una capacidad de comput
OpenAI descarta preocupaciones por la desaceleración del crecimiento y afirma que múltiples unidades de negocio están acelerando
En respuesta a la escrutinio externo sobre el desaceleramiento del crecimiento de las ventas y el incumplimiento de las metas internas, el líder en inteligencia artificial, OpenAI, emitió una declaración contundente el martes 28 de abril. La empresa











