Maison
Google dévoile l'architecture Gemma 4 E2B, une avancée majeure en matière d'IA embarquée

L'écosystème des grands modèles open source a réalisé une avancée majeure au niveau de son architecture sous-jacente. Google DeepMind a récemment lancé son modèle ouvert le plus puissant à ce jour, Gemma4. Si le nombre de paramètres du modèle reste similaire à celui de son prédécesseur, soit environ 30 milliards, son « intelligence par paramètre » a fait un bond en avant significatif. Ses performances sur plusieurs tâches clés rivalisent désormais avec celles des meilleurs modèles de grande taille à code source fermé d’il y a un an et demi.
L’innovation technologique la plus remarquable de Gemma4 réside dans l’introduction de la nouvelle architecture « E2B » (déchargement des paramètres). Dans les architectures Transformer traditionnelles, la couche d’embedding de grande taille consomme généralement une quantité importante de mémoire GPU. La nouvelle architecture ajoute intelligemment une table d’embedding dans chaque couche, remplaçant ainsi la multiplication matricielle complète, très gourmande en ressources, par un mécanisme de table de consultation. Par exemple, avec un modèle de 50 milliards de paramètres utilisant l’architecture E2B, seuls 20 milliards de paramètres doivent être chargés dans la mémoire du GPU, tandis que les 30 milliards restants peuvent être déchargés en toute sécurité vers le CPU, voire vers le disque. Cela permet au modèle d’effectuer une inférence rapide en utilisant seulement 2 Go de mémoire GPU, ce qui élimine les goulots d’étranglement liés au déploiement sur des appareils périphériques tels que les téléphones mobiles et le Raspberry Pi.
S'agissant d'une version très ambitieuse et complexe, l'équipe de Google DeepMind a coordonné ses efforts avec près de 50 partenaires externes, dont Hugging Face, llama.cpp, Ollama, NVIDIA et AMD. Actuellement, Gemma4 est profondément intégré à Android Studio. Les développeurs peuvent invoquer l’IA en toute sécurité pour écrire du code Android localement dans des environnements hors ligne, sans avoir à télécharger de code vers une API cloud, grâce au mode Agent. Cela répond largement à la forte demande en matière de confidentialité des données et de travail hors ligne sur le lieu de travail.
En termes de capacités multimodales et d’expérience de base, Gemma4 hérite des avancées de recherche de Gemini3. Même les petits modèles en périphérie, dotés de 2 milliards ou 4 milliards de paramètres, offrent une excellente prise en charge multilingue (140 langues) et une compréhension multimodale, gérant facilement la reconnaissance vocale, les requêtes vocales et l’analyse vidéo de 30 à 60 secondes. Bien que le modèle reste en retrait par rapport aux modèles plus volumineux en termes de capacité de connaissances absolue, et qu’il soit confronté à des défis reconnus par le secteur dans des domaines expérimentaux de pointe tels que la diffusion de texte (Diffusion Transformer) et le réglage fin par mélange d’experts (MoE), son intelligence à haute densité n’est plus négligeable.
À mesure que les capacités prêtes à l’emploi des grands modèles continuent de s’améliorer, l’écosystème de développement des domaines verticaux subit une profonde restructuration, et la popularité du réglage fin traditionnel pur s’estompe progressivement. Pour l’avenir, Google DeepMind a formulé une prévision marquante : d’ici un à deux ans, les smartphones des utilisateurs seront capables d’exécuter directement sur l’appareil des modèles puissants équivalents aux performances de Gemini3Pro. À ce moment-là, la plupart des tâches complexes des agents intelligents seront exécutées localement sans recourir à la puissance de calcul du cloud, ce qui apportera sans aucun doute des changements disruptifs à l’intégration des applications grand public de nouvelle génération et à l’expérience utilisateur.
Article connexe
Le service des ressources humaines d'Uber va épuiser son budget annuel en quatre mois et procède à des licenciements ; un responsable dément tout lien avec l'IA
Uber a lancé une refonte en profondeur de son département des ressources humaines, dirigé par la nouvelle présidente Jill Hazelbaker. Cette restructuration prévoit une réduction de 23 % des effectifs
D'anciens dirigeants de TikTok lancent une application basée sur l'IA pour maîtriser les poses photographiques
Les entreprises ont de plus en plus recours à la génération d’images par IA pour former les utilisateurs aux techniques photographiques. L’année dernière, Google a lancé « Camera Coach » sur les appar
Le secteur des modèles d'intelligence artificielle boursiers de Hong Kong enregistre une hausse alors que MiniMax et Zhipu affichent de solides gains
Le 27 mai, le secteur des grands modèles de langage sur le marché boursier de Hong Kong a fait preuve d’une dynamique robuste. À la mi-journée, MINIMAX-W (00100.HK) a bondi de plus de 8 %, tandis que Zhipu (02513.HK) enregistrait également de solides
Recommandations de sujets spéciaux liés
commentaires (0)

L'écosystème des grands modèles open source a réalisé une avancée majeure au niveau de son architecture sous-jacente. Google DeepMind a récemment lancé son modèle ouvert le plus puissant à ce jour, Gemma4. Si le nombre de paramètres du modèle reste similaire à celui de son prédécesseur, soit environ 30 milliards, son « intelligence par paramètre » a fait un bond en avant significatif. Ses performances sur plusieurs tâches clés rivalisent désormais avec celles des meilleurs modèles de grande taille à code source fermé d’il y a un an et demi.
L’innovation technologique la plus remarquable de Gemma4 réside dans l’introduction de la nouvelle architecture « E2B » (déchargement des paramètres). Dans les architectures Transformer traditionnelles, la couche d’embedding de grande taille consomme généralement une quantité importante de mémoire GPU. La nouvelle architecture ajoute intelligemment une table d’embedding dans chaque couche, remplaçant ainsi la multiplication matricielle complète, très gourmande en ressources, par un mécanisme de table de consultation. Par exemple, avec un modèle de 50 milliards de paramètres utilisant l’architecture E2B, seuls 20 milliards de paramètres doivent être chargés dans la mémoire du GPU, tandis que les 30 milliards restants peuvent être déchargés en toute sécurité vers le CPU, voire vers le disque. Cela permet au modèle d’effectuer une inférence rapide en utilisant seulement 2 Go de mémoire GPU, ce qui élimine les goulots d’étranglement liés au déploiement sur des appareils périphériques tels que les téléphones mobiles et le Raspberry Pi.
S'agissant d'une version très ambitieuse et complexe, l'équipe de Google DeepMind a coordonné ses efforts avec près de 50 partenaires externes, dont Hugging Face, llama.cpp, Ollama, NVIDIA et AMD. Actuellement, Gemma4 est profondément intégré à Android Studio. Les développeurs peuvent invoquer l’IA en toute sécurité pour écrire du code Android localement dans des environnements hors ligne, sans avoir à télécharger de code vers une API cloud, grâce au mode Agent. Cela répond largement à la forte demande en matière de confidentialité des données et de travail hors ligne sur le lieu de travail.
En termes de capacités multimodales et d’expérience de base, Gemma4 hérite des avancées de recherche de Gemini3. Même les petits modèles en périphérie, dotés de 2 milliards ou 4 milliards de paramètres, offrent une excellente prise en charge multilingue (140 langues) et une compréhension multimodale, gérant facilement la reconnaissance vocale, les requêtes vocales et l’analyse vidéo de 30 à 60 secondes. Bien que le modèle reste en retrait par rapport aux modèles plus volumineux en termes de capacité de connaissances absolue, et qu’il soit confronté à des défis reconnus par le secteur dans des domaines expérimentaux de pointe tels que la diffusion de texte (Diffusion Transformer) et le réglage fin par mélange d’experts (MoE), son intelligence à haute densité n’est plus négligeable.
À mesure que les capacités prêtes à l’emploi des grands modèles continuent de s’améliorer, l’écosystème de développement des domaines verticaux subit une profonde restructuration, et la popularité du réglage fin traditionnel pur s’estompe progressivement. Pour l’avenir, Google DeepMind a formulé une prévision marquante : d’ici un à deux ans, les smartphones des utilisateurs seront capables d’exécuter directement sur l’appareil des modèles puissants équivalents aux performances de Gemini3Pro. À ce moment-là, la plupart des tâches complexes des agents intelligents seront exécutées localement sans recourir à la puissance de calcul du cloud, ce qui apportera sans aucun doute des changements disruptifs à l’intégration des applications grand public de nouvelle génération et à l’expérience utilisateur.
Le service des ressources humaines d'Uber va épuiser son budget annuel en quatre mois et procède à des licenciements ; un responsable dément tout lien avec l'IA
Uber a lancé une refonte en profondeur de son département des ressources humaines, dirigé par la nouvelle présidente Jill Hazelbaker. Cette restructuration prévoit une réduction de 23 % des effectifs
D'anciens dirigeants de TikTok lancent une application basée sur l'IA pour maîtriser les poses photographiques
Les entreprises ont de plus en plus recours à la génération d’images par IA pour former les utilisateurs aux techniques photographiques. L’année dernière, Google a lancé « Camera Coach » sur les appar
Le secteur des modèles d'intelligence artificielle boursiers de Hong Kong enregistre une hausse alors que MiniMax et Zhipu affichent de solides gains
Le 27 mai, le secteur des grands modèles de langage sur le marché boursier de Hong Kong a fait preuve d’une dynamique robuste. À la mi-journée, MINIMAX-W (00100.HK) a bondi de plus de 8 %, tandis que Zhipu (02513.HK) enregistrait également de solides











