TurboQuant: la compresión de IA de Google que ahora funciona en CPU

TurboQuant: la compresión de IA de Google que ahora funciona en CPU

TurboQuant: la compresión de IA de Google que ahora funciona en CPU

Google ha introducido TurboQuant, una nueva técnica de cuantización diseñada para modelos de lenguaje grandes y búsqueda vectorial. La investigación apunta a uno de los cuellos de botella más persistentes en el despliegue de IA: el cache KV, que crece proporcionalmente con la longitud del contexto y ha obligado historicamente a los equipos a recurrir a costosos clusters de GPU. TurboQuant cambia la ecuación. Al comprimir las entradas del cache KV a alrededor de 3 bits sin ajuste fino y sin pérdida de precisión, hace viable la inferencia de IA en hardware CPU ordinario, el tipo que impulsa los servidores en la nube estándar hoy en día.

TurboQuant AI compression

Como funciona TurboQuant

TurboQuant es un sistema de dos partes. PolarQuant maneja la mayor parte del trabajo de compresión, reduciendo la mayoría de los datos. QJL luego realiza el paso restante de corrección de errores de 1 bit. Juntos logran una cuantización del cache KV de 3 bits. No se requiere ajuste fino y la precisión en benchmarks estándar se preserva. La idea clave es que estos dos métodos son complementarios: cada uno compensa el error residual del otro de una manera que suma hasta los límites de compresión casi teoricos.

QJL: El truco de 1 bit sin sobrecarga

QJL aplica la transformación de Johnson-Lindenstrauss a vectores de clave y valor de alta dimensión. Esta transformación matemática es conocida por reducir datos mientras preserva las distancias relativas entre puntos. QJL va más allá reduciendo cada vector a un único bit de signo, ya sea +1 o -1 por dimensión. El resultado es una reducción extrema en la huella de memoria sin sobrecarga adicional. El calculo de puntuaciones de atención permanece preciso porque la proyección de bit de signo preserva las relaciones geometricas que más importan durante la inferencia.

PolarQuant: Un nuevo angulo en la compresión

PolarQuant replantea el problema de compresión geometricamente. En lugar de trabajar en coordenadas cartesianas estándar, convierte vectores a forma polar: un radio que representa la magnitud y angulos que representan la dirección. Esto elimina el costoso paso de normalización que requieren la mayoría de los métodos de cuantización. La representación polar se mapea naturalmente en una cuadricula circular predecible que se cuantiza limpiamente. Las transformaciones polares recursivas pueden destilar un vector de alta dimensión completo a un único radio combinado con un conjunto compacto de angulos.

Experimentos y resultados

El equipo de Google evaluo TurboQuant en una serie de benchmarks de contexto largo: LongBench, Needle-in-Haystack, ZeroSCROLLS, RULER y L-Eval. Los modelos probados incluyen Gemma, Mistral y Llama-3.1-8B-Instruct. La memoria del cache KV se redujo 6x o más. Con cuantización de 4 bits, TurboQuant logra una aceleración de 8x sobre el estándar de 32 bits en GPUs H100. Para tareas de búsqueda vectorial, TurboQuant supera tanto a Product Quantization como a las bases de RaBitQ.

La inferencia en CPU ya esta lista para producción

Esta es la conclusión práctica. TurboQuant comprime los modelos tan agresivamente que la inferencia en CPU se vuelve viable para cargas de trabajo de producción reales, no solo para demostraciones de investigación. La comunidad de llama.cpp lo reconocio rápidamente y ya ha publicado ramas de implementación funcionales:

Los servidores en la nube, como los disponibles en DCXV, ahora son más que capaces de ejecutar inferencia de IA sin ningún hardware GPU. Si ha estado esperando una razón para mover cargas de trabajo de IA de costosas instancias GPU a maquinas virtuales en la nube estándar, TurboQuant es esa razón. Consulte https://dcxv.com/data-center#cloud para opciones de servidores en la nube actuales.

Mirando hacia adelante

TurboQuant resuelve el cuello de botella del cache KV que ha limitado los modelos a escala Gemini desde su lanzamiento. También habilita búsqueda vectorial semantica de alta calidad a la propia escala operativa de Google. Los benchmarks sugieren que el método se acerca a límites inferiores casi teoricos para esta clase de compresión. A medida que las capacidades de IA se integran más profundamente en los productos de software, la cuantización eficiente se convierte en infraestructura fundamental, no en una curiosidad de investigación.

Cómo conectarte a tu nuevo servidor cloud por SSH
sshtutorialcloud

Cómo conectarte a tu nuevo servidor cloud por SSH

El servidor está listo y el panel muestra IP, usuario y contraseña. Aquí tienes la primera conexión SSH, los cuatro errores más comunes y los primeros diez minutos.

Cómo conectarte a un servidor Windows con Escritorio remoto
rdpwindowstutorialcloud

Cómo conectarte a un servidor Windows con Escritorio remoto

Tienes una dirección, un usuario y una contraseña. Así se convierten en un escritorio de Windows en tu pantalla, desde un PC, un Mac o un móvil, paso a paso.

Servidor cloud para Stable Diffusion en Europa: configuración GPU
cloudaigpu

Servidor cloud para Stable Diffusion en Europa: configuración GPU

Ejecuta Stable Diffusion en un servidor cloud EU compatible con GDPR. Cubre GPU, configuración de AUTOMATIC1111 y ComfyUI, almacenamiento de modelos y benchmarks.

Servidor cloud para hosting LLM en Europa: guía de IA RGPD
cloudaigpu

Servidor cloud para hosting LLM en Europa: guía de IA RGPD

Hospeda grandes modelos de lenguaje en un servidor cloud EU conforme al RGPD. Cubre requisitos GPU, cuantización, frameworks de API y benchmarks de rendimiento.

Ejecuta Claude Code, Codex y Grok CLI en tu propio servidor cloud
cloudaivps

Ejecuta Claude Code, Codex y Grok CLI en tu propio servidor cloud

Convierte un servidor cloud Debian o Ubuntu en un sandbox para agentes de IA como Claude Code, Codex y Grok CLI. Programa desde cualquier lugar.