TurboQuant: стиснення ШІ від Google, яке тепер працює на CPU
Google представила TurboQuant - нову техніку квантизації для великих мовних моделей і векторного пошуку. Дослідження спрямоване на одне з найстійкіших вузьких місць у розгортанні ШІ: KV-кеш, який зростає пропорційно до довжини контексту і традиційно вимагав дорогих кластерів GPU. TurboQuant змінює ситуацію. Стискаючи записи KV-кешу приблизно до 3 бітів без донавчання і без втрати точності, він робить інференс ШІ можливим на звичайному залізі CPU - такому, що використовується у стандартних хмарних серверах сьогодні.

Як працює TurboQuant
TurboQuant - це двокомпонентна система. PolarQuant бере на себе основну роботу зі стиснення, зменшуючи більшу частину даних. QJL потім виконує залишковий прохід виправлення помилок в 1 біт. Разом вони досягають 3-бітної квантизації KV-кешу. Донавчання не потрібне, точність на стандартних тестах зберігається. Ключова ідея полягає в тому, що ці два методи доповнюють один одного: кожен компенсує залишкову помилку іншого таким чином, що в результаті досягаються майже теоретичні межі стиснення.
QJL: хитрість одного біта без накладних витрат
QJL застосовує перетворення Джонсона-Лінденштрауса до багатовимірних векторів ключів і значень. Це математичне перетворення відоме тим, що зменшує дані, зберігаючи відносні відстані між точками. QJL іде далі: зводить кожен вектор до одного знакового біта - або +1, або -1 для кожного виміру. Результат - радикальне зменшення пам'яті без жодних додаткових накладних витрат. Обчислення оцінок уваги залишається точним, оскільки знакова проекція зберігає геометричні співвідношення, які найбільш важливі під час інференсу.
PolarQuant: новий підхід до стиснення
PolarQuant переосмислює задачу стиснення з геометричної точки зору. Замість роботи в стандартних декартових координатах, він перетворює вектори в полярну форму: радіус представляє величину, кути - напрямок. Це усуває дорогий крок нормалізації, який потребує більшість методів квантизації. Полярне представлення природно відображається на передбачувану кругову сітку, яка квантується чисто. Рекурсивні полярні перетворення можуть згорнути повний багатовимірний вектор до одного радіуса у поєднанні з компактним набором кутів, досягаючи агресивного стиснення без спотворення даних.
Експерименти та результати
Команда Google оцінювала TurboQuant на ряді тестів для довгого контексту: LongBench, Needle-in-Haystack, ZeroSCROLLS, RULER та L-Eval. Тестувалися моделі Gemma, Mistral та Llama-3.1-8B-Instruct. Пам'ять KV-кешу зменшилась у 6 разів і більше. При 4-бітній квантизації TurboQuant досягає 8-кратного прискорення порівняно зі стандартним 32-бітним режимом на GPU H100. Для задач векторного пошуку TurboQuant перевершує базові методи Product Quantization та RaBitQ за показниками відновлення і якості пошуку.
Інференс на CPU вже готовий до продакшену
Це практичний висновок. TurboQuant стискає моделі настільки агресивно, що інференс на CPU стає можливим для реальних виробничих навантажень, а не лише для дослідних демо. Спільнота llama.cpp швидко це визнала і вже випустила робочі гілки реалізації:
- https://github.com/elusznik/llama.cpp/tree/turboquant-cpu-tbq-pr
- https://github.com/Aaryan-Kapoor/llama.cpp/tree/turboquant-tq3_0
Хмарні сервери - такі як доступні у DCXV - тепер цілком здатні виконувати інференс ШІ без будь-якого GPU-заліза. Якщо ви чекали причини перенести навантаження ШІ з дорогих GPU-інстансів на стандартні хмарні сервери, TurboQuant - саме ця причина. Дивіться https://dcxv.com/data-center#cloud для поточних варіантів хмарних серверів.
Перспективи
TurboQuant вирішує вузьке місце KV-кешу, яке обмежувало моделі масштабу Gemini з моменту їх виходу. Він також дозволяє виконувати якісний семантичний векторний пошук у власному операційному масштабі Google. Результати тестів свідчать про те, що метод наближається до теоретичних нижніх меж для цього класу стиснення. Оскільки можливості ШІ глибше інтегруються в програмні продукти, ефективна квантизація стає базовою інфраструктурою, а не дослідницькою цікавинкою. TurboQuant вказує на майбутнє, де потужний ШІ працює на стандартному залізі, доступному кожному, хто має звичайний сервер.