TurboQuant: стиснення ШІ від Google, яке тепер працює на CPU

TurboQuant: стиснення ШІ від Google, яке тепер працює на CPU

TurboQuant: стиснення ШІ від Google, яке тепер працює на CPU

Google представила TurboQuant - нову техніку квантизації для великих мовних моделей і векторного пошуку. Дослідження спрямоване на одне з найстійкіших вузьких місць у розгортанні ШІ: KV-кеш, який зростає пропорційно до довжини контексту і традиційно вимагав дорогих кластерів GPU. TurboQuant змінює ситуацію. Стискаючи записи KV-кешу приблизно до 3 бітів без донавчання і без втрати точності, він робить інференс ШІ можливим на звичайному залізі CPU - такому, що використовується у стандартних хмарних серверах сьогодні.

TurboQuant AI compression

Як працює TurboQuant

TurboQuant - це двокомпонентна система. PolarQuant бере на себе основну роботу зі стиснення, зменшуючи більшу частину даних. QJL потім виконує залишковий прохід виправлення помилок в 1 біт. Разом вони досягають 3-бітної квантизації KV-кешу. Донавчання не потрібне, точність на стандартних тестах зберігається. Ключова ідея полягає в тому, що ці два методи доповнюють один одного: кожен компенсує залишкову помилку іншого таким чином, що в результаті досягаються майже теоретичні межі стиснення.

QJL: хитрість одного біта без накладних витрат

QJL застосовує перетворення Джонсона-Лінденштрауса до багатовимірних векторів ключів і значень. Це математичне перетворення відоме тим, що зменшує дані, зберігаючи відносні відстані між точками. QJL іде далі: зводить кожен вектор до одного знакового біта - або +1, або -1 для кожного виміру. Результат - радикальне зменшення пам'яті без жодних додаткових накладних витрат. Обчислення оцінок уваги залишається точним, оскільки знакова проекція зберігає геометричні співвідношення, які найбільш важливі під час інференсу.

PolarQuant: новий підхід до стиснення

PolarQuant переосмислює задачу стиснення з геометричної точки зору. Замість роботи в стандартних декартових координатах, він перетворює вектори в полярну форму: радіус представляє величину, кути - напрямок. Це усуває дорогий крок нормалізації, який потребує більшість методів квантизації. Полярне представлення природно відображається на передбачувану кругову сітку, яка квантується чисто. Рекурсивні полярні перетворення можуть згорнути повний багатовимірний вектор до одного радіуса у поєднанні з компактним набором кутів, досягаючи агресивного стиснення без спотворення даних.

Експерименти та результати

Команда Google оцінювала TurboQuant на ряді тестів для довгого контексту: LongBench, Needle-in-Haystack, ZeroSCROLLS, RULER та L-Eval. Тестувалися моделі Gemma, Mistral та Llama-3.1-8B-Instruct. Пам'ять KV-кешу зменшилась у 6 разів і більше. При 4-бітній квантизації TurboQuant досягає 8-кратного прискорення порівняно зі стандартним 32-бітним режимом на GPU H100. Для задач векторного пошуку TurboQuant перевершує базові методи Product Quantization та RaBitQ за показниками відновлення і якості пошуку.

Інференс на CPU вже готовий до продакшену

Це практичний висновок. TurboQuant стискає моделі настільки агресивно, що інференс на CPU стає можливим для реальних виробничих навантажень, а не лише для дослідних демо. Спільнота llama.cpp швидко це визнала і вже випустила робочі гілки реалізації:

Хмарні сервери - такі як доступні у DCXV - тепер цілком здатні виконувати інференс ШІ без будь-якого GPU-заліза. Якщо ви чекали причини перенести навантаження ШІ з дорогих GPU-інстансів на стандартні хмарні сервери, TurboQuant - саме ця причина. Дивіться https://dcxv.com/data-center#cloud для поточних варіантів хмарних серверів.

Перспективи

TurboQuant вирішує вузьке місце KV-кешу, яке обмежувало моделі масштабу Gemini з моменту їх виходу. Він також дозволяє виконувати якісний семантичний векторний пошук у власному операційному масштабі Google. Результати тестів свідчать про те, що метод наближається до теоретичних нижніх меж для цього класу стиснення. Оскільки можливості ШІ глибше інтегруються в програмні продукти, ефективна квантизація стає базовою інфраструктурою, а не дослідницькою цікавинкою. TurboQuant вказує на майбутнє, де потужний ШІ працює на стандартному залізі, доступному кожному, хто має звичайний сервер.

Як підключитися до нового хмарного сервера через SSH
sshtutorialcloud

Як підключитися до нового хмарного сервера через SSH

Сервер готовий, а в панелі є IP, логін і пароль. Ось перше підключення через SSH, чотири помилки, які трапляються найчастіше, і перші десять хвилин.

Як підключитися до Windows-сервера через віддалений робочий стіл
rdpwindowstutorialcloud

Як підключитися до Windows-сервера через віддалений робочий стіл

У вас є адреса, ім'я користувача й пароль. Ось як перетворити їх на робочий стіл Windows у себе на екрані - з ПК, Mac чи телефона, крок за кроком.

Хмарний сервер для Stable Diffusion в Європі: GPU налаштування
cloudaigpu

Хмарний сервер для Stable Diffusion в Європі: GPU налаштування

Запустіть Stable Diffusion на хмарному сервері ЄС з дотриманням GDPR. Охоплює GPU, налаштування AUTOMATIC1111 і ComfyUI, зберігання моделей та орієнтири.

Хмарний сервер для хостингу LLM в Європі: посібник з ШІ
cloudaigpu

Хмарний сервер для хостингу LLM в Європі: посібник з ШІ

Розмістіть великі мовні моделі на хмарному сервері ЄС з дотриманням GDPR. Охоплює GPU, квантизацію, фреймворки API та орієнтири пропускної здатності.

Запускайте Claude Code, Codex та Grok CLI на власному хмарному сервері
cloudaivps

Запускайте Claude Code, Codex та Grok CLI на власному хмарному сервері

Перетворіть хмарний сервер Debian або Ubuntu на пісочницю для AI-агентів кодування - Claude Code, Codex, Grok CLI. Кодьте звідусіль, навіть з телефона.