Hogar
Google TurboQuant comprime la caché de los modelos de lenguaje a gran escala (LLM) seis veces más y multiplica por ocho la velocidad, sin necesidad de entrenamiento y sin pérdida de precisión alguna
El 26 de marzo, Google Research anunció el lanzamiento de TurboQuant, un nuevo algoritmo de compresión por cuantificación vectorial que combina las tecnologías PolarQuant y QJL. Esta innovación reduce al menos seis veces los requisitos de memoria de la caché de clave-valor (KV Cache) en la inferencia de modelos de lenguaje a gran escala (LLM). En las GPU Nvidia H100, mejora la velocidad de cálculo de la atención hasta ocho veces, al tiempo que mantiene una pérdida de precisión nula en múltiples pruebas de rendimiento con contextos largos. Se espera que este avance reduzca los costes de implementación de la IA y acelere la adopción de aplicaciones con contextos largos.
Puntos débiles de la caché KV: sobrecarga de memoria de vectores de alta dimensión
Al procesar secuencias largas, los LLM deben mantener una caché de vectores de clave y valor. Estos vectores de alta dimensión permiten realizar cálculos rápidos del mecanismo de atención sin computaciones redundantes. Sin embargo, a medida que aumenta la longitud del contexto, el consumo de memoria de la caché KV crece exponencialmente, convirtiéndose en un importante cuello de botella que limita la eficiencia de la inferencia del modelo y la escala de implementación.

Aunque los métodos tradicionales de cuantificación vectorial pueden comprimir datos, requieren almacenamiento adicional para las constantes de cuantificación, como los factores de escala y los puntos cero. Estas constantes suelen almacenarse con precisión completa, lo que añade entre 1 y 2 bits adicionales por valor y contrarresta parcialmente los beneficios de la compresión.
Innovación principal de TurboQuant: compresión en dos fases con PolarQuant + QJL
TurboQuant adopta un marco de compresión en dos fases que no requiere entrenamiento y que aborda de manera eficaz la sobrecarga de la cuantificación tradicional:
PolarQuant (compresión en coordenadas polares):
En primer lugar, los vectores se giran aleatoriamente; a continuación, las coordenadas cartesianas (X/Y/Z, etc.) se convierten a forma polar (ángulo + radio). Dado que los ángulos se encuentran dentro de un rango fijo y predecible, este método elimina la sobrecarga de almacenamiento necesaria para la normalización de límites en la cuantificación tradicional, lo que permite una compresión más eficiente.
QJL (corrección de errores de 1 bit, Johnson-Lindenstrauss cuantificado):
Tras la compresión con PolarQuant, persisten errores residuales. QJL utiliza la transformada de Johnson-Lindenstrauss para la reducción de dimensionalidad y, a continuación, cuantifica mediante un esquema mínimo de 1 bit (signo +1/-1). Al emplear un estimador especial no sesgado, logra la corrección de errores durante el cálculo de la puntuación de atención sin una sobrecarga de memoria adicional, lo que garantiza que el proceso global siga siendo imparcial.
En conjunto, TurboQuant comprime la caché KV a aproximadamente 3 bits por valor, al tiempo que mantiene la imparcialidad y una alta precisión en la estimación del producto interno.
Rendimiento en pruebas de referencia: liderazgo generalizado, ideal para contextos largos
El equipo de Google llevó a cabo una validación exhaustiva en modelos de código abierto como Gemma y Mistral:
LongBench (que abarca tareas como preguntas y respuestas con textos largos, generación de código y resumen): TurboQuant iguala o supera las referencias existentes, como KIVI, demostrando un liderazgo general.«Needle In A Haystack» y otras tareas de recuperación: alcanza puntuaciones perfectas en las tareas posteriores al tiempo que comprime la memoria KV al menos seis veces. Resultados de las pruebas con Nvidia H100: con una configuración de 4 bits, la velocidad de cálculo de los logits de atención mejora hasta ocho veces.Además, en conjuntos de datos vectoriales como GloVe, la tasa de recuperación de TurboQuant supera a la de métodos tradicionales como PQ y RabbiQ.
Comentario de AIbase: TurboQuant no requiere reentrenamiento ni ajuste fino del modelo y puede aplicarse directamente a los LLM existentes. Es adecuado para cualquier escenario que se base en la cuantificación vectorial, incluyendo la recuperación de bases de datos, los sistemas de recomendación y los motores de búsqueda vectorial. Esto no solo permite que una única GPU de consumo pueda gestionar contextos más largos (por ejemplo, decenas de miles de tokens), sino que también reduce significativamente el umbral de hardware necesario para los servicios de IA a nivel empresarial.
Importancia para el sector: un nuevo punto de referencia para la eficiencia de la inferencia de IA
Con la explosión de las aplicaciones de contexto largo y multimodales, la memoria de caché KV se ha convertido en una limitación fundamental de la infraestructura de IA. El marco de cuantificación «casi óptimo e independiente de los datos» de TurboQuant abre una nueva vía para una inferencia eficiente. Google Research ha señalado que esta tecnología se ha detallado en artículos presentados en ICLR 2026 y otras conferencias, y se espera que el código y los detalles de implementación relacionados se publiquen gradualmente como código abierto.
Se prevé que, en el futuro, TurboQuant se integre en marcos de inferencia generalizados, como vLLM y TensorRT, lo que impulsará aún más la democratización y la escalabilidad del despliegue de la IA.
Artículo relacionado
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas
Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
El 26 de marzo, Google Research anunció el lanzamiento de TurboQuant, un nuevo algoritmo de compresión por cuantificación vectorial que combina las tecnologías PolarQuant y QJL. Esta innovación reduce al menos seis veces los requisitos de memoria de la caché de clave-valor (KV Cache) en la inferencia de modelos de lenguaje a gran escala (LLM). En las GPU Nvidia H100, mejora la velocidad de cálculo de la atención hasta ocho veces, al tiempo que mantiene una pérdida de precisión nula en múltiples pruebas de rendimiento con contextos largos. Se espera que este avance reduzca los costes de implementación de la IA y acelere la adopción de aplicaciones con contextos largos.
Puntos débiles de la caché KV: sobrecarga de memoria de vectores de alta dimensión
Al procesar secuencias largas, los LLM deben mantener una caché de vectores de clave y valor. Estos vectores de alta dimensión permiten realizar cálculos rápidos del mecanismo de atención sin computaciones redundantes. Sin embargo, a medida que aumenta la longitud del contexto, el consumo de memoria de la caché KV crece exponencialmente, convirtiéndose en un importante cuello de botella que limita la eficiencia de la inferencia del modelo y la escala de implementación.

Aunque los métodos tradicionales de cuantificación vectorial pueden comprimir datos, requieren almacenamiento adicional para las constantes de cuantificación, como los factores de escala y los puntos cero. Estas constantes suelen almacenarse con precisión completa, lo que añade entre 1 y 2 bits adicionales por valor y contrarresta parcialmente los beneficios de la compresión.
Innovación principal de TurboQuant: compresión en dos fases con PolarQuant + QJL
TurboQuant adopta un marco de compresión en dos fases que no requiere entrenamiento y que aborda de manera eficaz la sobrecarga de la cuantificación tradicional:
PolarQuant (compresión en coordenadas polares):
En primer lugar, los vectores se giran aleatoriamente; a continuación, las coordenadas cartesianas (X/Y/Z, etc.) se convierten a forma polar (ángulo + radio). Dado que los ángulos se encuentran dentro de un rango fijo y predecible, este método elimina la sobrecarga de almacenamiento necesaria para la normalización de límites en la cuantificación tradicional, lo que permite una compresión más eficiente.
QJL (corrección de errores de 1 bit, Johnson-Lindenstrauss cuantificado):
Tras la compresión con PolarQuant, persisten errores residuales. QJL utiliza la transformada de Johnson-Lindenstrauss para la reducción de dimensionalidad y, a continuación, cuantifica mediante un esquema mínimo de 1 bit (signo +1/-1). Al emplear un estimador especial no sesgado, logra la corrección de errores durante el cálculo de la puntuación de atención sin una sobrecarga de memoria adicional, lo que garantiza que el proceso global siga siendo imparcial.
En conjunto, TurboQuant comprime la caché KV a aproximadamente 3 bits por valor, al tiempo que mantiene la imparcialidad y una alta precisión en la estimación del producto interno.
Rendimiento en pruebas de referencia: liderazgo generalizado, ideal para contextos largos
El equipo de Google llevó a cabo una validación exhaustiva en modelos de código abierto como Gemma y Mistral:
LongBench (que abarca tareas como preguntas y respuestas con textos largos, generación de código y resumen): TurboQuant iguala o supera las referencias existentes, como KIVI, demostrando un liderazgo general.«Needle In A Haystack» y otras tareas de recuperación: alcanza puntuaciones perfectas en las tareas posteriores al tiempo que comprime la memoria KV al menos seis veces. Resultados de las pruebas con Nvidia H100: con una configuración de 4 bits, la velocidad de cálculo de los logits de atención mejora hasta ocho veces.Además, en conjuntos de datos vectoriales como GloVe, la tasa de recuperación de TurboQuant supera a la de métodos tradicionales como PQ y RabbiQ.
Comentario de AIbase: TurboQuant no requiere reentrenamiento ni ajuste fino del modelo y puede aplicarse directamente a los LLM existentes. Es adecuado para cualquier escenario que se base en la cuantificación vectorial, incluyendo la recuperación de bases de datos, los sistemas de recomendación y los motores de búsqueda vectorial. Esto no solo permite que una única GPU de consumo pueda gestionar contextos más largos (por ejemplo, decenas de miles de tokens), sino que también reduce significativamente el umbral de hardware necesario para los servicios de IA a nivel empresarial.
Importancia para el sector: un nuevo punto de referencia para la eficiencia de la inferencia de IA
Con la explosión de las aplicaciones de contexto largo y multimodales, la memoria de caché KV se ha convertido en una limitación fundamental de la infraestructura de IA. El marco de cuantificación «casi óptimo e independiente de los datos» de TurboQuant abre una nueva vía para una inferencia eficiente. Google Research ha señalado que esta tecnología se ha detallado en artículos presentados en ICLR 2026 y otras conferencias, y se espera que el código y los detalles de implementación relacionados se publiquen gradualmente como código abierto.
Se prevé que, en el futuro, TurboQuant se integre en marcos de inferencia generalizados, como vLLM y TensorRT, lo que impulsará aún más la democratización y la escalabilidad del despliegue de la IA.
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en











