TurboQuant: a compressao de IA do Google que agora roda na CPU
O Google introduziu o TurboQuant, uma nova técnica de quantização projetada para grandes modelos de linguagem e busca vetorial. A pesquisa mira em um dos gargalos mais persistentes no deploy de IA: o cache KV, que cresce proporcionalmente ao comprimento do contexto e historicamente forcou equipes a recorrer a clusters de GPU caros. O TurboQuant muda a equação. Ao comprimir entradas do cache KV para cerca de 3 bits sem ajuste fino e sem perda de precisao, torna a inferência de IA viavel em hardware CPU comum, o tipo que alimenta servidores em nuvem padrão hoje em dia.

Como o TurboQuant funciona
O TurboQuant e um sistema de duas partes. O PolarQuant lida com a maior parte do trabalho de compressao, reduzindo a maioria dos dados. O QJL então realiza o passo restante de correção de erro de 1 bit. Juntos eles alcancam quantização de cache KV de 3 bits. Nenhum ajuste fino e necessário, e a precisao em benchmarks padrão e preservada. A ideia central e que esses dois métodos sao complementares: cada um compensa o erro residual do outro de uma maneira que soma ate limites de compressao quase teoricos.
QJL: O truque do 1 bit sem sobrecarga
O QJL aplica a transformação de Johnson-Lindenstrauss a vetores de chave e valor de alta dimensao. Essa transformação matemática e conhecida por reduzir dados enquanto preserva distancias relativas entre pontos. O QJL vai alem, reduzindo cada vetor a um único bit de sinal, seja +1 ou -1 por dimensao. O resultado e uma reducao extrema na pegada de memória sem sobrecarga adicional. O calculo dos scores de atenção permanece preciso porque a projeção de bit de sinal preserva as relações geometricas mais importantes durante a inferência.
PolarQuant: Um novo angulo na compressao
O PolarQuant reformula o problema de compressao geometricamente. Em vez de trabalhar em coordenadas cartesianas padrão, converte vetores em forma polar: um raio representando a magnitude e angulos representando a direção. Isso elimina o passo de normalização caro que a maioria dos métodos de quantização requer. A representação polar se mapeia naturalmente em uma grade circular previsivel que quantiza de forma limpa. Transformações polares recursivas podem destilar um vetor de alta dimensao completo em um único raio combinado com um conjunto compacto de angulos.
Experimentos e resultados
A equipe do Google avaliou o TurboQuant em uma série de benchmarks de contexto longo: LongBench, Needle-in-Haystack, ZeroSCROLLS, RULER e L-Eval. Os modelos testados incluem Gemma, Mistral e Llama-3.1-8B-Instruct. A memória do cache KV foi reduzida em 6x ou mais. Com quantização de 4 bits, o TurboQuant alcanca uma aceleração de 8x em relação ao padrão de 32 bits em GPUs H100. Para tarefas de busca vetorial, o TurboQuant supera tanto Product Quantization quanto as baselines RaBitQ.
A inferência em CPU ja esta pronta para produção
Esta e a conclusão pratica. O TurboQuant comprime modelos tão agressivamente que a inferência em CPU se torna viavel para cargas de trabalho de produção reais, não apenas para demonstrações de pesquisa. A comunidade llama.cpp reconheceu isso rapidamente e ja publicou branches de implementação funcionais:
- https://github.com/elusznik/llama.cpp/tree/turboquant-cpu-tbq-pr
- https://github.com/Aaryan-Kapoor/llama.cpp/tree/turboquant-tq3_0
Servidores em nuvem, como os disponíveis na DCXV, agora sao mais do que capazes de executar inferência de IA sem qualquer hardware GPU. Se você estava esperando uma razão para mover cargas de trabalho de IA de instâncias GPU caras para VMs em nuvem padrão, o TurboQuant e essa razão. Consulte https://dcxv.com/data-center#cloud para opções atuais de servidores em nuvem.
Olhando para o futuro
O TurboQuant resolve o gargalo do cache KV que tem limitado modelos na escala Gemini desde seu lancamento. Ele também habilita busca vetorial semantica de alta qualidade na própria escala operacional do Google. Os benchmarks sugerem que o método esta se aproximando de limites inferiores quase teoricos para essa classe de compressao. A medida que as capacidades de IA se integram mais profundamente nos produtos de software, a quantização eficiente se torna infraestrutura fundamental, não uma curiosidade de pesquisa.