TurboQuant: la compresión de IA de Google que ahora funciona en CPU
Google ha introducido TurboQuant, una nueva técnica de cuantización diseñada para modelos de lenguaje grandes y búsqueda vectorial. La investigación apunta a uno de los cuellos de botella más persistentes en el despliegue de IA: el cache KV, que crece proporcionalmente con la longitud del contexto y ha obligado historicamente a los equipos a recurrir a costosos clusters de GPU. TurboQuant cambia la ecuación. Al comprimir las entradas del cache KV a alrededor de 3 bits sin ajuste fino y sin pérdida de precisión, hace viable la inferencia de IA en hardware CPU ordinario, el tipo que impulsa los servidores en la nube estándar hoy en día.

Como funciona TurboQuant
TurboQuant es un sistema de dos partes. PolarQuant maneja la mayor parte del trabajo de compresión, reduciendo la mayoría de los datos. QJL luego realiza el paso restante de corrección de errores de 1 bit. Juntos logran una cuantización del cache KV de 3 bits. No se requiere ajuste fino y la precisión en benchmarks estándar se preserva. La idea clave es que estos dos métodos son complementarios: cada uno compensa el error residual del otro de una manera que suma hasta los límites de compresión casi teoricos.
QJL: El truco de 1 bit sin sobrecarga
QJL aplica la transformación de Johnson-Lindenstrauss a vectores de clave y valor de alta dimensión. Esta transformación matemática es conocida por reducir datos mientras preserva las distancias relativas entre puntos. QJL va más allá reduciendo cada vector a un único bit de signo, ya sea +1 o -1 por dimensión. El resultado es una reducción extrema en la huella de memoria sin sobrecarga adicional. El calculo de puntuaciones de atención permanece preciso porque la proyección de bit de signo preserva las relaciones geometricas que más importan durante la inferencia.
PolarQuant: Un nuevo angulo en la compresión
PolarQuant replantea el problema de compresión geometricamente. En lugar de trabajar en coordenadas cartesianas estándar, convierte vectores a forma polar: un radio que representa la magnitud y angulos que representan la dirección. Esto elimina el costoso paso de normalización que requieren la mayoría de los métodos de cuantización. La representación polar se mapea naturalmente en una cuadricula circular predecible que se cuantiza limpiamente. Las transformaciones polares recursivas pueden destilar un vector de alta dimensión completo a un único radio combinado con un conjunto compacto de angulos.
Experimentos y resultados
El equipo de Google evaluo TurboQuant en una serie de benchmarks de contexto largo: LongBench, Needle-in-Haystack, ZeroSCROLLS, RULER y L-Eval. Los modelos probados incluyen Gemma, Mistral y Llama-3.1-8B-Instruct. La memoria del cache KV se redujo 6x o más. Con cuantización de 4 bits, TurboQuant logra una aceleración de 8x sobre el estándar de 32 bits en GPUs H100. Para tareas de búsqueda vectorial, TurboQuant supera tanto a Product Quantization como a las bases de RaBitQ.
La inferencia en CPU ya esta lista para producción
Esta es la conclusión práctica. TurboQuant comprime los modelos tan agresivamente que la inferencia en CPU se vuelve viable para cargas de trabajo de producción reales, no solo para demostraciones de investigación. La comunidad de llama.cpp lo reconocio rápidamente y ya ha publicado ramas de implementación funcionales:
- https://github.com/elusznik/llama.cpp/tree/turboquant-cpu-tbq-pr
- https://github.com/Aaryan-Kapoor/llama.cpp/tree/turboquant-tq3_0
Los servidores en la nube, como los disponibles en DCXV, ahora son más que capaces de ejecutar inferencia de IA sin ningún hardware GPU. Si ha estado esperando una razón para mover cargas de trabajo de IA de costosas instancias GPU a maquinas virtuales en la nube estándar, TurboQuant es esa razón. Consulte https://dcxv.com/data-center#cloud para opciones de servidores en la nube actuales.
Mirando hacia adelante
TurboQuant resuelve el cuello de botella del cache KV que ha limitado los modelos a escala Gemini desde su lanzamiento. También habilita búsqueda vectorial semantica de alta calidad a la propia escala operativa de Google. Los benchmarks sugieren que el método se acerca a límites inferiores casi teoricos para esta clase de compresión. A medida que las capacidades de IA se integran más profundamente en los productos de software, la cuantización eficiente se convierte en infraestructura fundamental, no en una curiosidad de investigación.