opção
JohnYoung
JohnYoung
26 de Março de 2026

O Google revelou a tecnologia de compressão de memória TurboQuant AI em 26 de março de 2026. Ela reduz o uso da memória de cache KV para um sexto, sem perda de precisão, e aumenta a velocidade de inferência em oito vezes nas GPUs H100. A tecnologia utiliza compressão de 3 bits sem pré-treinamento, mantendo o desempenho total em testes de contexto longo

O Google revelou a tecnologia de compressão de memória TurboQuant AI em 26 de março de 2026. Ela reduz o uso da memória de cache KV para um sexto, sem perda de precisão, e aumenta a velocidade de inferência em oito vezes nas GPUs H100. A tecnologia utiliza compressão de 3 bits sem pré-treinamento, mantendo o desempenho total em testes de contexto longo O Google revelou a tecnologia de compressão de memória TurboQuant AI em 26 de março de 2026. Ela reduz o uso da memória de cache KV para um sexto, sem perda de precisão, e aumenta a velocidade de inferência em oito vezes nas GPUs H100. A tecnologia utiliza compressão de 3 bits sem pré-treinamento, mantendo o desempenho total em testes de contexto longo O Google revelou a tecnologia de compressão de memória TurboQuant AI em 26 de março de 2026. Ela reduz o uso da memória de cache KV para um sexto, sem perda de precisão, e aumenta a velocidade de inferência em oito vezes nas GPUs H100. A tecnologia utiliza compressão de 3 bits sem pré-treinamento, mantendo o desempenho total em testes de contexto longo
Comentários (0)
0/300
OR