Ми пропонуємо
Наші демократичні ціни на послуги
Тільки Брендове Обладнання, Повний Контроль, Ніяких Обмежень Трафіку, Ніяких Сюрпризів!
NVIDIA GPU-сервери для AI, машинного навчання та рендерингу у EU-дата-центрах Tier III
Тільки Брендове Обладнання, Повний Контроль, Ніяких Обмежень Трафіку, Ніяких Сюрпризів!
Корпоративна інфраструктура з гарантією 99.9% аптайму по локаціях ЄС
Отримайте ваші сервери та ресурси онлайн за години, а не дні. Жодної комісії за встановлення
GDPR-сумісні операції з усіма даними, що зберігаються в європейських дата-центрах
GPU-сервер - це виділена машина з одним чи кількома прискорювачами в наших власних європейських стійках. Ви отримуєте карту цілком, а не поділену в часі частку, разом із CPU, RAM і NVMe, щоб її годувати, - і саме це зазвичай визначає реальну пропускну здатність.
Доступні карти змінюються разом із постачанням, тож чесним переліком є сторінка конфігурації, а не фіксована таблиця тут. Що не змінюється - це форма: достатньо системної пам'яті, щоб утримати модель під час завантаження, NVMe, достатньо швидкий, щоб завантаження даних не стало вузьким місцем, і мережевий порт, крізь який пройде набір даних.
Практичне обмеження - VRAM. Модель на 7 мільярдів параметрів, квантована до 4 біт, вільно вміщується на карті 16 ГБ і лишає місце для корисного вікна контексту; 13B хоче 24 ГБ; модель 70B за тієї ж квантизації потребує близько 40-48 ГБ або двох карт. Обслуговування в повній 16-бітній точності приблизно подвоює кожне з цих чисел.
Якщо модель не вміщується, відповідь - квантизація, менша модель або ще одна карта, а не вивантаження в системну пам'ять, яке перетворює інтерактивного помічника на пакетне завдання.
vLLM для обслуговування з високою пропускною здатністю та сумісним з OpenAI ендпоінтом, Ollama, коли зручність важливіша за пікові токени за секунду, llama.cpp для найменшого сліду і PyTorch безпосередньо для всього нестандартного. Усе це встановлюється так само, як на будь-якій машині з Ubuntu, бо саме нею вона і є.
Інференс чутливий до затримок і обмежений здебільшого VRAM та пропускною здатністю пам'яті: одна карта, достатньо велика, і короткий шлях до клієнта. Він працює безперервно, тож машина з місячною оплатою - дешевше рішення.
Навчання і донавчання обмежені пропускною здатністю та приходять сплесками. Їм потрібно більше карт, значно більше системної пам'яті і NVMe, достатній для набору даних. Якщо робота нерегулярна, беріть розмір під пік і повертайте машину, замість платити за кремній, що простоює.
Причина, з якої більшість наших GPU-клієнтів тут, - не ціна. А те, що модель на машині, яку ви орендуєте в Празі чи Ковільяні, не надсилає запити третій стороні, не навчає чиюсь чужу модель на ваших документах і перебуває в юрисдикції, яку ви можете назвати в договорі про обробку даних.
Це має значення для всього, що торкається клієнтських записів, договорів, медичних чи фінансових даних, - для навантажень, де публічний API інференсу є проблемою відповідності ще до того, як стає технічною.
GPU-машини фізичні й збираються під замовлення, тож термін довший, ніж у хмарного сервера: скажіть підтримці, яку модель плануєте обслуговувати та з якою паралельністю, і вам назвуть найменшу карту, що з цим впорається, а не найбільшу на складі.
Обидва майданчики Tier III можуть їх розмістити, і вибір іде за вашими користувачами так само, як для будь-якого іншого сервера.
Часті питання
Усю карту. GPU-сервер - це виділена машина з під'єднаним прискорювачем, разом із CPU, RAM і NVMe, потрібними, щоб його годувати, і зазвичай саме це, а не карта сама по собі, визначає реальну пропускну здатність
Обмеженням є VRAM. Модель на 7 мільярдів параметрів, квантована до 4 біт, вільно вміщується в 16 ГБ і лишає місце для корисного вікна контексту, 13B потребує 24 ГБ, а модель 70B за тієї ж квантизації - близько 40-48 ГБ або двох карт. Обслуговування в повній 16-бітній точності приблизно подвоює кожне число
Будь-що, що працює на Ubuntu з драйверами NVIDIA: vLLM для обслуговування з високою пропускною здатністю та сумісним з OpenAI ендпоінтом, Ollama, коли зручність важливіша за пікову пропускну здатність, llama.cpp для найменшого сліду або PyTorch безпосередньо для нестандартної роботи
Їм потрібні різні машини. Інференс обмежений затримками і здебільшого VRAM, тож достатньо велика карта в безперервній роботі - дешевше рішення. Навчання та донавчання обмежені пропускною здатністю і приходять сплесками: більше карт, значно більше системної пам'яті та NVMe, достатній для набору даних
Нікуди. Модель працює на машині, яку ви орендуєте в Празі чи Ковільяні: запити не надсилаються третій стороні, ніщо не використовується для навчання чужої моделі, а юрисдикція - та, яку ви можете назвати в договорі про обробку даних
Довше, ніж хмарний сервер, бо машина фізична і збирається під замовлення. Скажіть підтримці, яку модель плануєте обслуговувати та якої паралельності очікуєте, і вони підберуть найменшу карту, що з цим впорається, а не найбільшу на складі
Якщо вам потрібна допомога або у вас виникли додаткові питання, будь ласка, звертайтеся до менеджерів або напишіть у службу підтримки за адресою support@dcxv.com