GPU-сервери у Європі

NVIDIA GPU-сервери для AI, машинного навчання та рендерингу у EU-дата-центрах Tier III

Сертифіковано за Tier III ISO 9001 ISO/IEC 27001 ISO 14001 Відповідає GDPR

Ми пропонуємо

Наші демократичні ціни на послуги

Тільки Брендове Обладнання, Повний Контроль, Ніяких Обмежень Трафіку, Ніяких Сюрпризів!

1
1
1
1
IP 1 IP
1 IP min max 7 IP
Місяці оплачені наперед 6 month
6 month min max 12 month

Чому обирають нас

Дата-центри TIER III

Корпоративна інфраструктура з гарантією 99.9% аптайму по локаціях ЄС

Миттєве розгортання

Отримайте ваші сервери та ресурси онлайн за години, а не дні. Жодної комісії за встановлення

Відповідність вимогам ЄС

GDPR-сумісні операції з усіма даними, що зберігаються в європейських дата-центрах

GPU-сервери для інференсу, навчання та рендерингу

GPU-сервер - це виділена машина з одним чи кількома прискорювачами в наших власних європейських стійках. Ви отримуєте карту цілком, а не поділену в часі частку, разом із CPU, RAM і NVMe, щоб її годувати, - і саме це зазвичай визначає реальну пропускну здатність.

Доступні карти змінюються разом із постачанням, тож чесним переліком є сторінка конфігурації, а не фіксована таблиця тут. Що не змінюється - це форма: достатньо системної пам'яті, щоб утримати модель під час завантаження, NVMe, достатньо швидкий, щоб завантаження даних не стало вузьким місцем, і мережевий порт, крізь який пройде набір даних.

Які розміри моделей поміщаються на яку карту

Практичне обмеження - VRAM. Модель на 7 мільярдів параметрів, квантована до 4 біт, вільно вміщується на карті 16 ГБ і лишає місце для корисного вікна контексту; 13B хоче 24 ГБ; модель 70B за тієї ж квантизації потребує близько 40-48 ГБ або двох карт. Обслуговування в повній 16-бітній точності приблизно подвоює кожне з цих чисел.

Якщо модель не вміщується, відповідь - квантизація, менша модель або ще одна карта, а не вивантаження в системну пам'ять, яке перетворює інтерактивного помічника на пакетне завдання.

Програмне забезпечення, яким справді користуються

vLLM для обслуговування з високою пропускною здатністю та сумісним з OpenAI ендпоінтом, Ollama, коли зручність важливіша за пікові токени за секунду, llama.cpp для найменшого сліду і PyTorch безпосередньо для всього нестандартного. Усе це встановлюється так само, як на будь-якій машині з Ubuntu, бо саме нею вона і є.

Інференс чи навчання - їм потрібні різні машини

Інференс чутливий до затримок і обмежений здебільшого VRAM та пропускною здатністю пам'яті: одна карта, достатньо велика, і короткий шлях до клієнта. Він працює безперервно, тож машина з місячною оплатою - дешевше рішення.

Навчання і донавчання обмежені пропускною здатністю та приходять сплесками. Їм потрібно більше карт, значно більше системної пам'яті і NVMe, достатній для набору даних. Якщо робота нерегулярна, беріть розмір під пік і повертайте машину, замість платити за кремній, що простоює.

Приватний ШІ, і де лежать дані

Причина, з якої більшість наших GPU-клієнтів тут, - не ціна. А те, що модель на машині, яку ви орендуєте в Празі чи Ковільяні, не надсилає запити третій стороні, не навчає чиюсь чужу модель на ваших документах і перебуває в юрисдикції, яку ви можете назвати в договорі про обробку даних.

Це має значення для всього, що торкається клієнтських записів, договорів, медичних чи фінансових даних, - для навантажень, де публічний API інференсу є проблемою відповідності ще до того, як стає технічною.

Локації та як отримати сервер

GPU-машини фізичні й збираються під замовлення, тож термін довший, ніж у хмарного сервера: скажіть підтримці, яку модель плануєте обслуговувати та з якою паралельністю, і вам назвуть найменшу карту, що з цим впорається, а не найбільшу на складі.

Обидва майданчики Tier III можуть їх розмістити, і вибір іде за вашими користувачами так само, як для будь-якого іншого сервера.

FAQ

Часті питання

Я отримую весь GPU чи його частку?

Усю карту. GPU-сервер - це виділена машина з під'єднаним прискорювачем, разом із CPU, RAM і NVMe, потрібними, щоб його годувати, і зазвичай саме це, а не карта сама по собі, визначає реальну пропускну здатність

Які розміри моделей поміщаються на яку карту?

Обмеженням є VRAM. Модель на 7 мільярдів параметрів, квантована до 4 біт, вільно вміщується в 16 ГБ і лишає місце для корисного вікна контексту, 13B потребує 24 ГБ, а модель 70B за тієї ж квантизації - близько 40-48 ГБ або двох карт. Обслуговування в повній 16-бітній точності приблизно подвоює кожне число

Які стеки обслуговування підтримуються?

Будь-що, що працює на Ubuntu з драйверами NVIDIA: vLLM для обслуговування з високою пропускною здатністю та сумісним з OpenAI ендпоінтом, Ollama, коли зручність важливіша за пікову пропускну здатність, llama.cpp для найменшого сліду або PyTorch безпосередньо для нестандартної роботи

GPU-сервер краще підходить для інференсу чи для навчання?

Їм потрібні різні машини. Інференс обмежений затримками і здебільшого VRAM, тож достатньо велика карта в безперервній роботі - дешевше рішення. Навчання та донавчання обмежені пропускною здатністю і приходять сплесками: більше карт, значно більше системної пам'яті та NVMe, достатній для набору даних

Куди потрапляють мої дані, коли я запускаю тут модель?

Нікуди. Модель працює на машині, яку ви орендуєте в Празі чи Ковільяні: запити не надсилаються третій стороні, ніщо не використовується для навчання чужої моделі, а юрисдикція - та, яку ви можете назвати в договорі про обробку даних

Скільки часу потрібно, щоб отримати такий сервер?

Довше, ніж хмарний сервер, бо машина фізична і збирається під замовлення. Скажіть підтримці, яку модель плануєте обслуговувати та якої паралельності очікуєте, і вони підберуть найменшу карту, що з цим впорається, а не найбільшу на складі

Якщо вам потрібна допомога або у вас виникли додаткові питання, будь ласка, звертайтеся до менеджерів або напишіть у службу підтримки за адресою support@dcxv.com