Maison
Google et NVIDIA mettent DiffusionGemma en open source, multipliant par quatre la vitesse d'inférence sur une seule carte
Le 10 juin 2026, Google a lancé DiffusionGemma, un modèle linguistique expérimental open source qui rompt avec le paradigme autorégressif traditionnel consistant à générer du texte mot par mot. Il est le premier à utiliser des mécanismes de diffusion issus de l'IA appliquée à l'image dans la génération de texte, en partant d'un bruit aléatoire et en affinant le résultat de manière itérative pour produire 256 blocs de tokens en parallèle à chaque étape.

En termes de performances matérielles, les optimisations approfondies de NVIDIA permettent au modèle de fonctionner près de quatre fois plus vite que des modèles traditionnels comparables en mode mono-GPU et mono-utilisateur. Sur un GPU H100, il atteint des vitesses de sortie allant jusqu’à 1 000 tokens par seconde pour une seule requête, et même sur des GPU grand public haut de gamme comme le RTX 5090, il peut dépasser les 700 tokens par seconde.
DiffusionGemma compte 26 milliards de paramètres et utilise une architecture de type « mixture-of-experts » (MoE), n’activant que 3,8 milliards de paramètres par étape. Bien que la qualité et la précision de sa génération de texte soient légèrement inférieures à celles des modèles traditionnels de la série Gemma4 sur les benchmarks standard, sa « prise en compte complète des blocs » unique en son genre surmonte la limitation des modèles autorégressifs, qui ne fonctionnent que de manière rétroactive. Comme tous les tokens peuvent se référencer mutuellement pendant la génération, il excelle dans les tâches impliquant des données non linéaires et structurées, telles que la complétion de texte, le remplissage de code, la résolution de Sudoku et le traitement de séquences d’acides aminés.

Les poids du modèle sont désormais disponibles en open source sur Hugging Face sous licence Apache 2.0 et fonctionnent de manière transparente avec les frameworks d’inférence courants tels que vLLM et MLX. Cette exploration élimine non seulement les contraintes de bande passante mémoire pesant sur la puissance de calcul des GPU, mais ouvre également une nouvelle voie technique pour les futures applications d’IA dans le domaine de la logique complexe et de la génération de texte non linéaire.
Article connexe
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles
Guident exploite une navette AuveTech dans le sud de la Floride, gérant un parcours de quatre miles à West Palm Beach et un parcours d’un mile à Boca Raton grâce à sa technologie de surveillance à dis
Recommandations de sujets spéciaux liés
commentaires (0)
Le 10 juin 2026, Google a lancé DiffusionGemma, un modèle linguistique expérimental open source qui rompt avec le paradigme autorégressif traditionnel consistant à générer du texte mot par mot. Il est le premier à utiliser des mécanismes de diffusion issus de l'IA appliquée à l'image dans la génération de texte, en partant d'un bruit aléatoire et en affinant le résultat de manière itérative pour produire 256 blocs de tokens en parallèle à chaque étape.

En termes de performances matérielles, les optimisations approfondies de NVIDIA permettent au modèle de fonctionner près de quatre fois plus vite que des modèles traditionnels comparables en mode mono-GPU et mono-utilisateur. Sur un GPU H100, il atteint des vitesses de sortie allant jusqu’à 1 000 tokens par seconde pour une seule requête, et même sur des GPU grand public haut de gamme comme le RTX 5090, il peut dépasser les 700 tokens par seconde.
DiffusionGemma compte 26 milliards de paramètres et utilise une architecture de type « mixture-of-experts » (MoE), n’activant que 3,8 milliards de paramètres par étape. Bien que la qualité et la précision de sa génération de texte soient légèrement inférieures à celles des modèles traditionnels de la série Gemma4 sur les benchmarks standard, sa « prise en compte complète des blocs » unique en son genre surmonte la limitation des modèles autorégressifs, qui ne fonctionnent que de manière rétroactive. Comme tous les tokens peuvent se référencer mutuellement pendant la génération, il excelle dans les tâches impliquant des données non linéaires et structurées, telles que la complétion de texte, le remplissage de code, la résolution de Sudoku et le traitement de séquences d’acides aminés.

Les poids du modèle sont désormais disponibles en open source sur Hugging Face sous licence Apache 2.0 et fonctionnent de manière transparente avec les frameworks d’inférence courants tels que vLLM et MLX. Cette exploration élimine non seulement les contraintes de bande passante mémoire pesant sur la puissance de calcul des GPU, mais ouvre également une nouvelle voie technique pour les futures applications d’IA dans le domaine de la logique complexe et de la génération de texte non linéaire.
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés











