Maison
Google TurboQuant réduit de 6 fois la taille du cache des modèles de langage à grande échelle (LLM), multiplie leur vitesse par 8, sans nécessiter d'entraînement et sans aucune perte de précision
Le 26 mars, Google Research a annoncé le lancement de TurboQuant, un nouvel algorithme de compression par quantification vectorielle qui combine les technologies PolarQuant et QJL. Cette innovation réduit d’au moins six fois les besoins en mémoire du cache clé-valeur (KV Cache) lors de l’inférence des grands modèles linguistiques (LLM). Sur les GPU Nvidia H100, elle multiplie par huit la vitesse de calcul de l’attention tout en conservant une précision parfaite dans plusieurs benchmarks à contexte long. Cette avancée devrait réduire les coûts de déploiement de l’IA et accélérer l’adoption d’applications à contexte long.
Problèmes liés au cache KV : surcharge mémoire liée aux vecteurs de haute dimension
Lors du traitement de longues séquences, les LLM doivent maintenir un cache de vecteurs de clés et de valeurs. Ces vecteurs de haute dimension permettent des calculs rapides du mécanisme d’attention sans calculs redondants. Cependant, à mesure que la longueur du contexte augmente, la consommation de mémoire du cache KV croît de manière exponentielle, devenant ainsi un goulot d’étranglement majeur qui limite l’efficacité de l’inférence du modèle et l’échelle de déploiement.

Si les méthodes traditionnelles de quantification vectorielle permettent de compresser les données, elles nécessitent un espace de stockage supplémentaire pour les constantes de quantification, telles que les facteurs d’échelle et les points zéro. Ces constantes sont généralement stockées en pleine précision, ce qui ajoute 1 à 2 bits supplémentaires par valeur et annule en partie les avantages de la compression.
Innovation centrale de TurboQuant : compression en deux phases avec PolarQuant + QJL
TurboQuant adopte un cadre de compression en deux phases ne nécessitant aucun apprentissage, qui résout efficacement la surcharge liée à la quantification traditionnelle :
PolarQuant (compression en coordonnées polaires) :
Tout d’abord, les vecteurs sont pivotés de manière aléatoire, puis les coordonnées cartésiennes (X/Y/Z, etc.) sont converties en coordonnées polaires (angle + rayon). Les angles se situant dans une plage fixe et prévisible, cette méthode élimine la surcharge de stockage liée à la normalisation des limites dans la quantification traditionnelle, permettant ainsi une compression plus efficace.
QJL (correction d’erreur sur 1 bit, Johnson-Lindenstrauss quantifié) :
Après la compression PolarQuant, des erreurs résiduelles subsistent. QJL utilise la transformée de Johnson-Lindenstrauss pour réduire la dimensionnalité, puis quantifie à l’aide d’un schéma minimal à 1 bit (signe +1/-1). En employant un estimateur non biaisé spécial, il permet de corriger les erreurs lors du calcul du score d’attention sans surcoût de mémoire supplémentaire, garantissant ainsi que le processus global reste non biaisé.
Combiné à ces techniques, TurboQuant compresse le cache KV à environ 3 bits par valeur tout en conservant l’absence de biais et une grande précision dans l’estimation du produit scalaire.
Performances aux tests de référence : leadership global, idéal pour les contextes longs
L’équipe de Google a mené une validation approfondie sur des modèles open source tels que Gemma et Mistral :
LongBench (couvrant des tâches telles que les questions-réponses sur de longs textes, la génération de code et la synthèse) : TurboQuant égale ou surpasse les références existantes telles que KIVI, démontrant ainsi une supériorité globale.« Needle In A Haystack » et autres tâches de recherche : il atteint des scores en aval parfaits tout en compressant la mémoire KV d’au moins six fois. Résultats des tests sur Nvidia H100 : avec une configuration à 4 bits, la vitesse de calcul des logits d’attention est multipliée par huit au maximum.De plus, sur des ensembles de données vectorielles comme GloVe, le taux de rappel de TurboQuant surpasse celui des méthodes traditionnelles telles que PQ et RabbiQ.
Commentaire d’AIbase : TurboQuant ne nécessite ni réentraînement ni réglage fin du modèle et peut être directement appliqué aux grands modèles de langage (LLM) existants. Il convient à tout scénario reposant sur la quantification vectorielle, y compris la recherche dans les bases de données, les systèmes de recommandation et les moteurs de recherche vectoriels. Cela permet non seulement à un simple GPU grand public de prendre en charge des contextes plus longs (par exemple, des dizaines de milliers de tokens), mais abaisse également considérablement le seuil matériel requis pour les services d’IA de niveau entreprise.
Importance pour le secteur : une nouvelle référence en matière d’efficacité de l’inférence IA
Avec l’explosion des applications à contexte long et multimodales, la mémoire cache KV est devenue une contrainte majeure dans l’infrastructure d’IA. Le cadre de quantification « quasi-optimal et indépendant des données » de TurboQuant ouvre une nouvelle voie vers une inférence efficace. Google Research a indiqué que cette technologie a été détaillée dans des articles présentés lors de l’ICLR 2026 et d’autres conférences, et que le code associé ainsi que les détails de mise en œuvre devraient être progressivement mis en open source.
À l’avenir, TurboQuant devrait être intégré aux frameworks d’inférence courants tels que vLLM et TensorRT, favorisant ainsi davantage la démocratisation et l’évolutivité du déploiement de l’IA.
Article connexe
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles
Guident exploite une navette AuveTech dans le sud de la Floride, gérant un parcours de quatre miles à West Palm Beach et un parcours d’un mile à Boca Raton grâce à sa technologie de surveillance à dis
Recommandations de sujets spéciaux liés
commentaires (0)
Le 26 mars, Google Research a annoncé le lancement de TurboQuant, un nouvel algorithme de compression par quantification vectorielle qui combine les technologies PolarQuant et QJL. Cette innovation réduit d’au moins six fois les besoins en mémoire du cache clé-valeur (KV Cache) lors de l’inférence des grands modèles linguistiques (LLM). Sur les GPU Nvidia H100, elle multiplie par huit la vitesse de calcul de l’attention tout en conservant une précision parfaite dans plusieurs benchmarks à contexte long. Cette avancée devrait réduire les coûts de déploiement de l’IA et accélérer l’adoption d’applications à contexte long.
Problèmes liés au cache KV : surcharge mémoire liée aux vecteurs de haute dimension
Lors du traitement de longues séquences, les LLM doivent maintenir un cache de vecteurs de clés et de valeurs. Ces vecteurs de haute dimension permettent des calculs rapides du mécanisme d’attention sans calculs redondants. Cependant, à mesure que la longueur du contexte augmente, la consommation de mémoire du cache KV croît de manière exponentielle, devenant ainsi un goulot d’étranglement majeur qui limite l’efficacité de l’inférence du modèle et l’échelle de déploiement.

Si les méthodes traditionnelles de quantification vectorielle permettent de compresser les données, elles nécessitent un espace de stockage supplémentaire pour les constantes de quantification, telles que les facteurs d’échelle et les points zéro. Ces constantes sont généralement stockées en pleine précision, ce qui ajoute 1 à 2 bits supplémentaires par valeur et annule en partie les avantages de la compression.
Innovation centrale de TurboQuant : compression en deux phases avec PolarQuant + QJL
TurboQuant adopte un cadre de compression en deux phases ne nécessitant aucun apprentissage, qui résout efficacement la surcharge liée à la quantification traditionnelle :
PolarQuant (compression en coordonnées polaires) :
Tout d’abord, les vecteurs sont pivotés de manière aléatoire, puis les coordonnées cartésiennes (X/Y/Z, etc.) sont converties en coordonnées polaires (angle + rayon). Les angles se situant dans une plage fixe et prévisible, cette méthode élimine la surcharge de stockage liée à la normalisation des limites dans la quantification traditionnelle, permettant ainsi une compression plus efficace.
QJL (correction d’erreur sur 1 bit, Johnson-Lindenstrauss quantifié) :
Après la compression PolarQuant, des erreurs résiduelles subsistent. QJL utilise la transformée de Johnson-Lindenstrauss pour réduire la dimensionnalité, puis quantifie à l’aide d’un schéma minimal à 1 bit (signe +1/-1). En employant un estimateur non biaisé spécial, il permet de corriger les erreurs lors du calcul du score d’attention sans surcoût de mémoire supplémentaire, garantissant ainsi que le processus global reste non biaisé.
Combiné à ces techniques, TurboQuant compresse le cache KV à environ 3 bits par valeur tout en conservant l’absence de biais et une grande précision dans l’estimation du produit scalaire.
Performances aux tests de référence : leadership global, idéal pour les contextes longs
L’équipe de Google a mené une validation approfondie sur des modèles open source tels que Gemma et Mistral :
LongBench (couvrant des tâches telles que les questions-réponses sur de longs textes, la génération de code et la synthèse) : TurboQuant égale ou surpasse les références existantes telles que KIVI, démontrant ainsi une supériorité globale.« Needle In A Haystack » et autres tâches de recherche : il atteint des scores en aval parfaits tout en compressant la mémoire KV d’au moins six fois. Résultats des tests sur Nvidia H100 : avec une configuration à 4 bits, la vitesse de calcul des logits d’attention est multipliée par huit au maximum.De plus, sur des ensembles de données vectorielles comme GloVe, le taux de rappel de TurboQuant surpasse celui des méthodes traditionnelles telles que PQ et RabbiQ.
Commentaire d’AIbase : TurboQuant ne nécessite ni réentraînement ni réglage fin du modèle et peut être directement appliqué aux grands modèles de langage (LLM) existants. Il convient à tout scénario reposant sur la quantification vectorielle, y compris la recherche dans les bases de données, les systèmes de recommandation et les moteurs de recherche vectoriels. Cela permet non seulement à un simple GPU grand public de prendre en charge des contextes plus longs (par exemple, des dizaines de milliers de tokens), mais abaisse également considérablement le seuil matériel requis pour les services d’IA de niveau entreprise.
Importance pour le secteur : une nouvelle référence en matière d’efficacité de l’inférence IA
Avec l’explosion des applications à contexte long et multimodales, la mémoire cache KV est devenue une contrainte majeure dans l’infrastructure d’IA. Le cadre de quantification « quasi-optimal et indépendant des données » de TurboQuant ouvre une nouvelle voie vers une inférence efficace. Google Research a indiqué que cette technologie a été détaillée dans des articles présentés lors de l’ICLR 2026 et d’autres conférences, et que le code associé ainsi que les détails de mise en œuvre devraient être progressivement mis en open source.
À l’avenir, TurboQuant devrait être intégré aux frameworks d’inférence courants tels que vLLM et TensorRT, favorisant ainsi davantage la démocratisation et l’évolutivité du déploiement de l’IA.
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés











