TurboQuant: la compression IA de Google qui fonctionne désormais sur CPU

TurboQuant: la compression IA de Google qui fonctionne désormais sur CPU

TurboQuant: la compression IA de Google qui fonctionne désormais sur CPU

Google a introduit TurboQuant, une nouvelle technique de quantification concue pour les grands modèles de langage et la recherche vectorielle. La recherche cible l'un des goulots d'etranglement les plus persistants dans le déploiement de l'IA: le cache KV, qui croit proportionnellement a la longueur du contexte et a historiquement force les equipes vers des clusters GPU coûteux. TurboQuant change la donne. En comprimant les entrees du cache KV a environ 3 bits sans réglage fin et sans perte de précision, il rend l'inférence IA viable sur du matériel CPU ordinaire, le type qui alimente les serveurs cloud standard aujourd'hui.

TurboQuant AI compression

Comment fonctionne TurboQuant

TurboQuant est un système en deux parties. PolarQuant gere l'essentiel du travail de compression, réduisant la majorite des données. QJL effectue ensuite la passe de correction d'erreur a 1 bit restante. Ensemble, ils atteignent une quantification du cache KV a 3 bits. Aucun réglage fin n'est requis, et la précision sur les benchmarks standard est preservee. L'idée clé est que ces deux methodes sont complementaires: chacune compense l'erreur residuelle de l'autre d'une manière qui aboutit a des limites de compression quasi theoriques.

QJL: L'astuce du 1 bit sans surcharge

QJL applique la transformation de Johnson-Lindenstrauss aux vecteurs de clés et de valeurs de haute dimension. Cette transformation mathématique est connue pour réduire les données tout en preservant les distances relatives entre les points. QJL va plus loin en réduisant chaque vecteur a un unique bit de signe, soit +1 soit -1 par dimension. Le résultat est une réduction extreme de l'empreinte mémoire sans surcharge supplémentaire. Le calcul des scores d'attention reste précis car la projection par bit de signe preserve les relations geometriques les plus importantes lors de l'inférence.

PolarQuant: Un nouvel angle sur la compression

PolarQuant recadre le problème de compression geometriquement. Plutôt que de travailler en coordonnees cartesiennes standard, il convertit les vecteurs en forme polaire: un rayon representant la magnitude et des angles representant la direction. Cela elimine l'étape de normalisation couteuse que la plupart des methodes de quantification nécessitent. La representation polaire se mappe naturellement sur une grille circulaire previsible qui se quantifie proprement. Les transformations polaires recursives peuvent distiller un vecteur haute dimension complet en un seul rayon combine a un ensemble compact d'angles.

Experiences et résultats

L'équipe Google a evalue TurboQuant sur une série de benchmarks a contexte long: LongBench, Needle-in-Haystack, ZeroSCROLLS, RULER et L-Eval. Les modèles testes incluent Gemma, Mistral et Llama-3.1-8B-Instruct. La mémoire du cache KV a été reduite de 6x ou plus. Avec une quantification a 4 bits, TurboQuant réalise une acceleration de 8x par rapport au 32 bits standard sur les GPU H100. Pour les tâches de recherche vectorielle, TurboQuant surpasse a la fois Product Quantization et les bases RaBitQ.

L'inférence sur CPU est désormais prête pour la production

C'est la conclusion pratique. TurboQuant comprime les modèles si agressivement que l'inférence sur CPU devient viable pour de vraies charges de travail en production, pas seulement pour des demonstrations de recherche. La communauté llama.cpp l'a rapidement reconnu et a déjà publié des branches d'implémentation fonctionnelles:

Les serveurs cloud, comme ceux disponibles chez DCXV, sont maintenant plus que capables d'exécuter l'inférence IA sans aucun matériel GPU. Si vous attendiez une raison de migrer les charges de travail IA des instances GPU coûteuses vers des VM cloud standard, TurboQuant est cette raison. Consultez https://dcxv.com/data-center#cloud pour les options actuelles de serveurs cloud.

Perspectives

TurboQuant resout le goulot d'etranglement du cache KV qui a contraint les modèles a l'échelle Gemini depuis leur lancement. Il permet egalement une recherche vectorielle semantique de haute qualite a l'échelle opérationnelle propre de Google. Les benchmarks suggèrent que la methode approche des limites inferieures quasi theoriques pour cette classe de compression. Alors que les capacités de l'IA s'integrent plus profondement dans les produits logiciels, la quantification efficiente devient une infrastructure fondamentale, pas une curiosite de recherche.

Comment se connecter à votre nouveau serveur cloud en SSH
sshtutorialcloud

Comment se connecter à votre nouveau serveur cloud en SSH

Le serveur est prêt et la console affiche IP, identifiant et mot de passe. Voici la première connexion SSH, les quatre erreurs les plus courantes et les dix premières minutes.

Comment se connecter à un serveur Windows avec le Bureau à distance
rdpwindowstutorialcloud

Comment se connecter à un serveur Windows avec le Bureau à distance

Vous avez une adresse, un identifiant et un mot de passe. Voici comment en faire un bureau Windows sur votre écran, depuis un PC, un Mac ou un téléphone, étape par étape.

Serveur cloud pour Stable Diffusion en Europe: configuration GPU
cloudaigpu

Serveur cloud pour Stable Diffusion en Europe: configuration GPU

Hébergez Stable Diffusion sur un serveur cloud EU conforme au RGPD. GPU, configuration AUTOMATIC1111 et ComfyUI, stockage de modèles et benchmarks de generation.

Serveur cloud pour hébergement LLM en Europe: guide IA RGPD
cloudaigpu

Serveur cloud pour hébergement LLM en Europe: guide IA RGPD

Hébergez de grands modèles de langage sur un serveur cloud EU conforme au RGPD. GPU, quantification, frameworks d'API et benchmarks de débit pour l'Europe.

Exécutez Claude Code, Codex et Grok CLI sur votre propre serveur cloud
cloudaivps

Exécutez Claude Code, Codex et Grok CLI sur votre propre serveur cloud

Transformez un serveur cloud Debian ou Ubuntu en bac à sable pour les agents IA comme Claude Code, Codex et Grok CLI. Codez depuis n'importe où.