Hogar
Google presenta la arquitectura Gemma 4 E2B, un avance revolucionario en el campo de la IA en el propio dispositivo

El ecosistema de modelos grandes de código abierto ha logrado un gran avance en su arquitectura subyacente. Google DeepMind ha lanzado recientemente su modelo abierto más potente hasta la fecha, Gemma4. Aunque el número de parámetros del modelo sigue siendo similar al de su predecesor, en torno a los 30 000 millones, su «inteligencia por parámetro» ha dado un salto significativo. Su rendimiento en varias tareas fundamentales rivaliza ahora con el de los mejores modelos de gran tamaño de código cerrado de hace un año y medio.
La innovación tecnológica más destacada de Gemma4 es la introducción de la nueva arquitectura «E2B» (descarga de parámetros). En los diseños tradicionales de Transformer, la capa de incrustación de gran tamaño suele consumir una cantidad significativa de memoria de la GPU. La nueva arquitectura añade de forma inteligente una tabla de incrustación en cada capa, sustituyendo la pesada multiplicación de matrices completas por un mecanismo de tabla de consulta. Por ejemplo, con un modelo de 50 000 millones de parámetros bajo la arquitectura E2B, solo es necesario cargar 20 000 millones de parámetros en la memoria de la GPU, mientras que los 30 000 millones restantes pueden descargarse de forma segura a la CPU o incluso al disco. Esto permite que el modelo realice inferencias rápidas utilizando tan solo 2 GB de memoria de la GPU, lo que supera los cuellos de botella de implementación en dispositivos periféricos como teléfonos móviles y Raspberry Pi.
Al tratarse de un lanzamiento muy ambicioso y complejo, el equipo de Google DeepMind ha colaborado con casi 50 socios externos, entre los que se incluyen Hugging Face, llama.cpp, Ollama, NVIDIA y AMD. Actualmente, Gemma4 está profundamente integrado con Android Studio. Los desarrolladores pueden invocar de forma segura la IA para escribir código de Android localmente en entornos sin conexión, sin necesidad de subir ningún código a una API en la nube en modo «Agent». Esto responde en gran medida a la fuerte demanda de privacidad de datos y de trabajo sin conexión en el ámbito laboral.
En cuanto a las capacidades multimodales y la experiencia de base, Gemma4 hereda los logros de investigación de Gemini3. Incluso los modelos periféricos más pequeños, con 2 000 millones o 4 000 millones de parámetros, ofrecen una excelente compatibilidad multilingüe (140 idiomas) y comprensión multimodal, gestionando con facilidad el reconocimiento de voz, las consultas de voz y el análisis de vídeos de entre 30 y 60 segundos. Aunque el modelo sigue estando por detrás de los modelos más grandes en cuanto a capacidad de conocimiento absoluta, y se enfrenta a retos reconocidos por el sector en áreas experimentales de vanguardia como la difusión de texto (Diffusion Transformer) y el ajuste fino mediante la mezcla de expertos (MoE), su inteligencia de alta densidad ya no es insignificante.
A medida que las capacidades de uso inmediato de los modelos grandes siguen mejorando, el ecosistema de desarrollo de dominios verticales está experimentando una profunda reestructuración, y la popularidad del ajuste fino tradicional puro está disminuyendo gradualmente. De cara al futuro, Google DeepMind ha realizado una predicción trascendental: en el plazo de uno o dos años, los smartphones de los usuarios podrán ejecutar modelos potentes, equivalentes al rendimiento de Gemini3Pro, directamente en el dispositivo. En ese momento, la mayoría de las tareas complejas de los agentes inteligentes se completarán de forma local sin depender de la potencia de cálculo en la nube, lo que sin duda traerá consigo cambios disruptivos en la integración de las aplicaciones de consumo de próxima generación y en la experiencia del usuario.
Artículo relacionado
El departamento de RR. HH. de Uber agotará su presupuesto anual en cuatro meses y recortará plantilla; un responsable niega que haya relación con la IA
Uber ha puesto en marcha una importante reorganización de su división de recursos humanos, dirigida por la nueva presidenta, Jill Hazelbaker. La reestructuración implica una reducción de la plantilla
Antiguos ejecutivos de TikTok lanzan una aplicación basada en IA para dominar las poses fotográficas
Las empresas recurren cada vez más a la generación de imágenes mediante IA para enseñar a los usuarios técnicas fotográficas. El año pasado, Google presentó Camera Coach en los dispositivos Pixel para
El sector de inteligencia artificial del mercado bursátil de Hong Kong registra alzas, mientras que MiniMax y Zhipu muestran fuertes ganancias
El 27 de mayo, el sector de los grandes modelos en el mercado bursátil de Hong Kong demostró un impulso sólido. Al mediodía, MINIMAX-W (00100.HK) subió más de 8%, mientras que Zhipu (02513.HK) también registró fuertes ganancias de casi 5%.1. Context
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

El ecosistema de modelos grandes de código abierto ha logrado un gran avance en su arquitectura subyacente. Google DeepMind ha lanzado recientemente su modelo abierto más potente hasta la fecha, Gemma4. Aunque el número de parámetros del modelo sigue siendo similar al de su predecesor, en torno a los 30 000 millones, su «inteligencia por parámetro» ha dado un salto significativo. Su rendimiento en varias tareas fundamentales rivaliza ahora con el de los mejores modelos de gran tamaño de código cerrado de hace un año y medio.
La innovación tecnológica más destacada de Gemma4 es la introducción de la nueva arquitectura «E2B» (descarga de parámetros). En los diseños tradicionales de Transformer, la capa de incrustación de gran tamaño suele consumir una cantidad significativa de memoria de la GPU. La nueva arquitectura añade de forma inteligente una tabla de incrustación en cada capa, sustituyendo la pesada multiplicación de matrices completas por un mecanismo de tabla de consulta. Por ejemplo, con un modelo de 50 000 millones de parámetros bajo la arquitectura E2B, solo es necesario cargar 20 000 millones de parámetros en la memoria de la GPU, mientras que los 30 000 millones restantes pueden descargarse de forma segura a la CPU o incluso al disco. Esto permite que el modelo realice inferencias rápidas utilizando tan solo 2 GB de memoria de la GPU, lo que supera los cuellos de botella de implementación en dispositivos periféricos como teléfonos móviles y Raspberry Pi.
Al tratarse de un lanzamiento muy ambicioso y complejo, el equipo de Google DeepMind ha colaborado con casi 50 socios externos, entre los que se incluyen Hugging Face, llama.cpp, Ollama, NVIDIA y AMD. Actualmente, Gemma4 está profundamente integrado con Android Studio. Los desarrolladores pueden invocar de forma segura la IA para escribir código de Android localmente en entornos sin conexión, sin necesidad de subir ningún código a una API en la nube en modo «Agent». Esto responde en gran medida a la fuerte demanda de privacidad de datos y de trabajo sin conexión en el ámbito laboral.
En cuanto a las capacidades multimodales y la experiencia de base, Gemma4 hereda los logros de investigación de Gemini3. Incluso los modelos periféricos más pequeños, con 2 000 millones o 4 000 millones de parámetros, ofrecen una excelente compatibilidad multilingüe (140 idiomas) y comprensión multimodal, gestionando con facilidad el reconocimiento de voz, las consultas de voz y el análisis de vídeos de entre 30 y 60 segundos. Aunque el modelo sigue estando por detrás de los modelos más grandes en cuanto a capacidad de conocimiento absoluta, y se enfrenta a retos reconocidos por el sector en áreas experimentales de vanguardia como la difusión de texto (Diffusion Transformer) y el ajuste fino mediante la mezcla de expertos (MoE), su inteligencia de alta densidad ya no es insignificante.
A medida que las capacidades de uso inmediato de los modelos grandes siguen mejorando, el ecosistema de desarrollo de dominios verticales está experimentando una profunda reestructuración, y la popularidad del ajuste fino tradicional puro está disminuyendo gradualmente. De cara al futuro, Google DeepMind ha realizado una predicción trascendental: en el plazo de uno o dos años, los smartphones de los usuarios podrán ejecutar modelos potentes, equivalentes al rendimiento de Gemini3Pro, directamente en el dispositivo. En ese momento, la mayoría de las tareas complejas de los agentes inteligentes se completarán de forma local sin depender de la potencia de cálculo en la nube, lo que sin duda traerá consigo cambios disruptivos en la integración de las aplicaciones de consumo de próxima generación y en la experiencia del usuario.
El departamento de RR. HH. de Uber agotará su presupuesto anual en cuatro meses y recortará plantilla; un responsable niega que haya relación con la IA
Uber ha puesto en marcha una importante reorganización de su división de recursos humanos, dirigida por la nueva presidenta, Jill Hazelbaker. La reestructuración implica una reducción de la plantilla
Antiguos ejecutivos de TikTok lanzan una aplicación basada en IA para dominar las poses fotográficas
Las empresas recurren cada vez más a la generación de imágenes mediante IA para enseñar a los usuarios técnicas fotográficas. El año pasado, Google presentó Camera Coach en los dispositivos Pixel para
El sector de inteligencia artificial del mercado bursátil de Hong Kong registra alzas, mientras que MiniMax y Zhipu muestran fuertes ganancias
El 27 de mayo, el sector de los grandes modelos en el mercado bursátil de Hong Kong demostró un impulso sólido. Al mediodía, MINIMAX-W (00100.HK) subió más de 8%, mientras que Zhipu (02513.HK) también registró fuertes ganancias de casi 5%.1. Context











