Maison
Google Gemma4 triple la vitesse, marquant ainsi l’arrivée réelle des grands modèles hors ligne

Juste quelques semaines après avoir fait sensation dans le domaine des modèles open-source, Google a une nouvelle fois amélioré de manière significative son modèle open-source le plus puissant, Gemma4. Le 5 mai au soir, heure locale, Google a officiellement lancé un générateur de drafts pour la prédiction multi-token (MTP) destiné à la série Gemma4. Cette avancée technologique utilise une architecture de décodage spéculatif pour augmenter la vitesse de raisonnement du modèle jusqu'à trois fois sans sacrifier la qualité des résultats ni les capacités logiques.
En tant que l'un des modèles open-source les plus utilisés dans le monde, Gemma4 a déjà enregistré plus de 60 millions de téléchargements depuis son lancement. L'objectif principal de cette mise à jour est de résoudre le problème persistant du ralentissement dans le raisonnement des grands modèles linguistiques et d'améliorer davantage l'efficacité computationnelle.
Analyse technique : Réaliser une "prévision" accélérée dans le raisonnement
Le raisonnement des modèles linguistiques traditionnels est souvent limité par la bande passante mémoire. En termes simples, lorsque le processeur génère du texte, le transfert de centaines de milliards de paramètres de la mémoire vers l'unité de calcul prend beaucoup de temps. Cette vitesse de transfert de données est bien plus lente que la vitesse de traitement, ce qui laisse les ressources matérielles inutilisées la plupart du temps et provoque des retards notables dans la réponse.
Pour résoudre ce problème, Google a introduit le décodage spéculatif. Son principe peut être compris comme une configuration "maître-esclave" : le système associe des modèles cibles lourds, tels que Gemma 4 31B, avec des générateurs de drafts MTP légers. Le générateur utilise les ressources informatiques inutilisées pour prédire à l'avance plusieurs tokens à venir, tandis que le modèle principal plus puissant effectue une vérification parallèle. Lorsque les prédictions correspondent, le modèle peut confirmer toute la séquence en une seule opération, réduisant ainsi considérablement le temps nécessaire pour générer du texte.
Résultats des tests : L'Apple Silicon et les cartes graphiques grand public bénéficient de gains importants
Selon les données officielles des tests, l'effet d'accélération est particulièrement notable sur les appareils locaux. Dans les environnements Apple Silicon, avec des tailles de lots comprises entre 4 et 8, la vitesse d'inference locale du modèle Gemma 4 26B a augmenté d'environ 2,2 fois.
Cela signifie que les développeurs peuvent maintenant exécuter plus facilement des assistants de programmation hors ligne complexes ou des workflows d'agents intelligents sur des ordinateurs personnels et des cartes graphiques grand public standard. De plus, l'amélioration de l'efficacité d'inference a également réduit considérablement la consommation d'énergie des appareils edge, ouvrant la voie à une adoption plus large de l'intelligence artificielle sur les appareils mobiles.
Les limites des applications de l'intelligence artificielle continuent de s'étendre
Cette mise à jour technique vise principalement des scénarios nécessitant une faible latence, tels que les chatbots en temps réel, les outils de programmation automatisés et divers agents autonomes. Avec le générateur MTP, Google a démontré qu'il est possible, même dans des environnements matériels limités en ressources, d'utiliser des modèles linguistiques de pointe sans compromettre la vitesse de réponse ni l'exactitude des calculs.
À mesure que le coût et les obstacles à l'inference continuent de diminuer, l'évolution de Gemma4 et des technologies qui la soutiennent poussent l'intelligence artificielle hors du cloud vers une plus grande variété d'appareils informatiques personnels.
Article connexe
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles
Guident exploite une navette AuveTech dans le sud de la Floride, gérant un parcours de quatre miles à West Palm Beach et un parcours d’un mile à Boca Raton grâce à sa technologie de surveillance à dis
Recommandations de sujets spéciaux liés
commentaires (0)

Juste quelques semaines après avoir fait sensation dans le domaine des modèles open-source, Google a une nouvelle fois amélioré de manière significative son modèle open-source le plus puissant, Gemma4. Le 5 mai au soir, heure locale, Google a officiellement lancé un générateur de drafts pour la prédiction multi-token (MTP) destiné à la série Gemma4. Cette avancée technologique utilise une architecture de décodage spéculatif pour augmenter la vitesse de raisonnement du modèle jusqu'à trois fois sans sacrifier la qualité des résultats ni les capacités logiques.
En tant que l'un des modèles open-source les plus utilisés dans le monde, Gemma4 a déjà enregistré plus de 60 millions de téléchargements depuis son lancement. L'objectif principal de cette mise à jour est de résoudre le problème persistant du ralentissement dans le raisonnement des grands modèles linguistiques et d'améliorer davantage l'efficacité computationnelle.
Analyse technique : Réaliser une "prévision" accélérée dans le raisonnement
Le raisonnement des modèles linguistiques traditionnels est souvent limité par la bande passante mémoire. En termes simples, lorsque le processeur génère du texte, le transfert de centaines de milliards de paramètres de la mémoire vers l'unité de calcul prend beaucoup de temps. Cette vitesse de transfert de données est bien plus lente que la vitesse de traitement, ce qui laisse les ressources matérielles inutilisées la plupart du temps et provoque des retards notables dans la réponse.
Pour résoudre ce problème, Google a introduit le décodage spéculatif. Son principe peut être compris comme une configuration "maître-esclave" : le système associe des modèles cibles lourds, tels que Gemma 4 31B, avec des générateurs de drafts MTP légers. Le générateur utilise les ressources informatiques inutilisées pour prédire à l'avance plusieurs tokens à venir, tandis que le modèle principal plus puissant effectue une vérification parallèle. Lorsque les prédictions correspondent, le modèle peut confirmer toute la séquence en une seule opération, réduisant ainsi considérablement le temps nécessaire pour générer du texte.
Résultats des tests : L'Apple Silicon et les cartes graphiques grand public bénéficient de gains importants
Selon les données officielles des tests, l'effet d'accélération est particulièrement notable sur les appareils locaux. Dans les environnements Apple Silicon, avec des tailles de lots comprises entre 4 et 8, la vitesse d'inference locale du modèle Gemma 4 26B a augmenté d'environ 2,2 fois.
Cela signifie que les développeurs peuvent maintenant exécuter plus facilement des assistants de programmation hors ligne complexes ou des workflows d'agents intelligents sur des ordinateurs personnels et des cartes graphiques grand public standard. De plus, l'amélioration de l'efficacité d'inference a également réduit considérablement la consommation d'énergie des appareils edge, ouvrant la voie à une adoption plus large de l'intelligence artificielle sur les appareils mobiles.
Les limites des applications de l'intelligence artificielle continuent de s'étendre
Cette mise à jour technique vise principalement des scénarios nécessitant une faible latence, tels que les chatbots en temps réel, les outils de programmation automatisés et divers agents autonomes. Avec le générateur MTP, Google a démontré qu'il est possible, même dans des environnements matériels limités en ressources, d'utiliser des modèles linguistiques de pointe sans compromettre la vitesse de réponse ni l'exactitude des calculs.
À mesure que le coût et les obstacles à l'inference continuent de diminuer, l'évolution de Gemma4 et des technologies qui la soutiennent poussent l'intelligence artificielle hors du cloud vers une plus grande variété d'appareils informatiques personnels.
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés











