TurboQuant: la compression IA de Google qui fonctionne désormais sur CPU
Google a introduit TurboQuant, une nouvelle technique de quantification concue pour les grands modèles de langage et la recherche vectorielle. La recherche cible l'un des goulots d'etranglement les plus persistants dans le déploiement de l'IA: le cache KV, qui croit proportionnellement a la longueur du contexte et a historiquement force les equipes vers des clusters GPU coûteux. TurboQuant change la donne. En comprimant les entrees du cache KV a environ 3 bits sans réglage fin et sans perte de précision, il rend l'inférence IA viable sur du matériel CPU ordinaire, le type qui alimente les serveurs cloud standard aujourd'hui.

Comment fonctionne TurboQuant
TurboQuant est un système en deux parties. PolarQuant gere l'essentiel du travail de compression, réduisant la majorite des données. QJL effectue ensuite la passe de correction d'erreur a 1 bit restante. Ensemble, ils atteignent une quantification du cache KV a 3 bits. Aucun réglage fin n'est requis, et la précision sur les benchmarks standard est preservee. L'idée clé est que ces deux methodes sont complementaires: chacune compense l'erreur residuelle de l'autre d'une manière qui aboutit a des limites de compression quasi theoriques.
QJL: L'astuce du 1 bit sans surcharge
QJL applique la transformation de Johnson-Lindenstrauss aux vecteurs de clés et de valeurs de haute dimension. Cette transformation mathématique est connue pour réduire les données tout en preservant les distances relatives entre les points. QJL va plus loin en réduisant chaque vecteur a un unique bit de signe, soit +1 soit -1 par dimension. Le résultat est une réduction extreme de l'empreinte mémoire sans surcharge supplémentaire. Le calcul des scores d'attention reste précis car la projection par bit de signe preserve les relations geometriques les plus importantes lors de l'inférence.
PolarQuant: Un nouvel angle sur la compression
PolarQuant recadre le problème de compression geometriquement. Plutôt que de travailler en coordonnees cartesiennes standard, il convertit les vecteurs en forme polaire: un rayon representant la magnitude et des angles representant la direction. Cela elimine l'étape de normalisation couteuse que la plupart des methodes de quantification nécessitent. La representation polaire se mappe naturellement sur une grille circulaire previsible qui se quantifie proprement. Les transformations polaires recursives peuvent distiller un vecteur haute dimension complet en un seul rayon combine a un ensemble compact d'angles.
Experiences et résultats
L'équipe Google a evalue TurboQuant sur une série de benchmarks a contexte long: LongBench, Needle-in-Haystack, ZeroSCROLLS, RULER et L-Eval. Les modèles testes incluent Gemma, Mistral et Llama-3.1-8B-Instruct. La mémoire du cache KV a été reduite de 6x ou plus. Avec une quantification a 4 bits, TurboQuant réalise une acceleration de 8x par rapport au 32 bits standard sur les GPU H100. Pour les tâches de recherche vectorielle, TurboQuant surpasse a la fois Product Quantization et les bases RaBitQ.
L'inférence sur CPU est désormais prête pour la production
C'est la conclusion pratique. TurboQuant comprime les modèles si agressivement que l'inférence sur CPU devient viable pour de vraies charges de travail en production, pas seulement pour des demonstrations de recherche. La communauté llama.cpp l'a rapidement reconnu et a déjà publié des branches d'implémentation fonctionnelles:
- https://github.com/elusznik/llama.cpp/tree/turboquant-cpu-tbq-pr
- https://github.com/Aaryan-Kapoor/llama.cpp/tree/turboquant-tq3_0
Les serveurs cloud, comme ceux disponibles chez DCXV, sont maintenant plus que capables d'exécuter l'inférence IA sans aucun matériel GPU. Si vous attendiez une raison de migrer les charges de travail IA des instances GPU coûteuses vers des VM cloud standard, TurboQuant est cette raison. Consultez https://dcxv.com/data-center#cloud pour les options actuelles de serveurs cloud.
Perspectives
TurboQuant resout le goulot d'etranglement du cache KV qui a contraint les modèles a l'échelle Gemini depuis leur lancement. Il permet egalement une recherche vectorielle semantique de haute qualite a l'échelle opérationnelle propre de Google. Les benchmarks suggèrent que la methode approche des limites inferieures quasi theoriques pour cette classe de compression. Alors que les capacités de l'IA s'integrent plus profondement dans les produits logiciels, la quantification efficiente devient une infrastructure fondamentale, pas une curiosite de recherche.