TurboQuant: a compressao de IA do Google que agora roda na CPU

TurboQuant: a compressao de IA do Google que agora roda na CPU

TurboQuant: a compressao de IA do Google que agora roda na CPU

O Google introduziu o TurboQuant, uma nova técnica de quantização projetada para grandes modelos de linguagem e busca vetorial. A pesquisa mira em um dos gargalos mais persistentes no deploy de IA: o cache KV, que cresce proporcionalmente ao comprimento do contexto e historicamente forcou equipes a recorrer a clusters de GPU caros. O TurboQuant muda a equação. Ao comprimir entradas do cache KV para cerca de 3 bits sem ajuste fino e sem perda de precisao, torna a inferência de IA viavel em hardware CPU comum, o tipo que alimenta servidores em nuvem padrão hoje em dia.

TurboQuant AI compression

Como o TurboQuant funciona

O TurboQuant e um sistema de duas partes. O PolarQuant lida com a maior parte do trabalho de compressao, reduzindo a maioria dos dados. O QJL então realiza o passo restante de correção de erro de 1 bit. Juntos eles alcancam quantização de cache KV de 3 bits. Nenhum ajuste fino e necessário, e a precisao em benchmarks padrão e preservada. A ideia central e que esses dois métodos sao complementares: cada um compensa o erro residual do outro de uma maneira que soma ate limites de compressao quase teoricos.

QJL: O truque do 1 bit sem sobrecarga

O QJL aplica a transformação de Johnson-Lindenstrauss a vetores de chave e valor de alta dimensao. Essa transformação matemática e conhecida por reduzir dados enquanto preserva distancias relativas entre pontos. O QJL vai alem, reduzindo cada vetor a um único bit de sinal, seja +1 ou -1 por dimensao. O resultado e uma reducao extrema na pegada de memória sem sobrecarga adicional. O calculo dos scores de atenção permanece preciso porque a projeção de bit de sinal preserva as relações geometricas mais importantes durante a inferência.

PolarQuant: Um novo angulo na compressao

O PolarQuant reformula o problema de compressao geometricamente. Em vez de trabalhar em coordenadas cartesianas padrão, converte vetores em forma polar: um raio representando a magnitude e angulos representando a direção. Isso elimina o passo de normalização caro que a maioria dos métodos de quantização requer. A representação polar se mapeia naturalmente em uma grade circular previsivel que quantiza de forma limpa. Transformações polares recursivas podem destilar um vetor de alta dimensao completo em um único raio combinado com um conjunto compacto de angulos.

Experimentos e resultados

A equipe do Google avaliou o TurboQuant em uma série de benchmarks de contexto longo: LongBench, Needle-in-Haystack, ZeroSCROLLS, RULER e L-Eval. Os modelos testados incluem Gemma, Mistral e Llama-3.1-8B-Instruct. A memória do cache KV foi reduzida em 6x ou mais. Com quantização de 4 bits, o TurboQuant alcanca uma aceleração de 8x em relação ao padrão de 32 bits em GPUs H100. Para tarefas de busca vetorial, o TurboQuant supera tanto Product Quantization quanto as baselines RaBitQ.

A inferência em CPU ja esta pronta para produção

Esta e a conclusão pratica. O TurboQuant comprime modelos tão agressivamente que a inferência em CPU se torna viavel para cargas de trabalho de produção reais, não apenas para demonstrações de pesquisa. A comunidade llama.cpp reconheceu isso rapidamente e ja publicou branches de implementação funcionais:

Servidores em nuvem, como os disponíveis na DCXV, agora sao mais do que capazes de executar inferência de IA sem qualquer hardware GPU. Se você estava esperando uma razão para mover cargas de trabalho de IA de instâncias GPU caras para VMs em nuvem padrão, o TurboQuant e essa razão. Consulte https://dcxv.com/data-center#cloud para opções atuais de servidores em nuvem.

Olhando para o futuro

O TurboQuant resolve o gargalo do cache KV que tem limitado modelos na escala Gemini desde seu lancamento. Ele também habilita busca vetorial semantica de alta qualidade na própria escala operacional do Google. Os benchmarks sugerem que o método esta se aproximando de limites inferiores quase teoricos para essa classe de compressao. A medida que as capacidades de IA se integram mais profundamente nos produtos de software, a quantização eficiente se torna infraestrutura fundamental, não uma curiosidade de pesquisa.

Como se conectar ao seu novo servidor cloud por SSH
sshtutorialcloud

Como se conectar ao seu novo servidor cloud por SSH

O servidor está pronto e o painel mostra IP, login e senha. Aqui está a primeira conexão SSH, os quatro erros mais comuns e os primeiros dez minutos.

Como se conectar a um servidor Windows com a Área de Trabalho Remota
rdpwindowstutorialcloud

Como se conectar a um servidor Windows com a Área de Trabalho Remota

Você tem um endereço, um usuário e uma senha. Veja como transformá-los em uma área de trabalho do Windows na sua tela, de um PC, Mac ou celular, passo a passo.

Servidor cloud para Stable Diffusion na Europa: configuração GPU
cloudaigpu

Servidor cloud para Stable Diffusion na Europa: configuração GPU

Execute Stable Diffusion em um servidor cloud da UE em conformidade com o RGPD. GPU, configuração AUTOMATIC1111 e ComfyUI, armazenamento de modelos e benchmarks.

Servidor cloud para hosting LLM na Europa: guia de IA RGPD
cloudaigpu

Servidor cloud para hosting LLM na Europa: guia de IA RGPD

Hospede grandes modelos de linguagem em um servidor cloud da UE em conformidade com o RGPD. GPU, quantização, frameworks de API e benchmarks para a Europa.

Execute Claude Code, Codex e Grok CLI no seu próprio servidor cloud
cloudaivps

Execute Claude Code, Codex e Grok CLI no seu próprio servidor cloud

Transforme um servidor cloud Debian ou Ubuntu num sandbox para agentes de IA como Claude Code, Codex e Grok CLI. Programe a partir de qualquer lugar.