Serwery GPU w Polsce

Serwery GPU NVIDIA do AI, uczenia maszynowego i renderowania w centrach danych Tier III w UE

Certyfikat Tier III ISO 9001 ISO/IEC 27001 ISO 14001 Zgodność z RODO

Proponujemy

Nasze przystępne ceny

Tylko markowy sprzęt, pełna kontrola, bez limitów ruchu, bez niespodzianek!

1
1
1
1
IP 1 IP
1 IP min max 7 IP
Miesiące opłacone z góry 6 month
6 month min max 12 month

Dlaczego nas wybrać

Centra danych TIER III

Infrastruktura klasy korporacyjnej z gwarancją 99,9% dostępności w lokalizacjach UE

Natychmiastowe wdrożenie

Uruchom swoje serwery i zasoby online w ciągu godzin, nie dni. Bez opłaty za instalację

Zgodność z UE

Operacje zgodne z GDPR ze wszystkimi danymi przechowywanymi w europejskich centrach danych

Serwery GPU do inferencji, treningu i renderowania

Serwer GPU to dedykowana maszyna z jednym lub kilkoma akceleratorami, w naszych europejskich szafach. Dostajesz całą kartę - nie jej ułamek dzielony w czasie - wraz z CPU, RAM i NVMe potrzebnymi, by ją nakarmić, a to zwykle decyduje o realnej przepustowości.

Dostępne karty zmieniają się wraz z dostawami, więc uczciwą listą jest strona konfiguracji, a nie sztywna tabela w tym tekście. Nie zmienia się natomiast kształt: dość pamięci systemowej, by utrzymać model podczas ładowania, NVMe na tyle szybkie, żeby wczytywanie danych nie było wąskim gardłem, i port sieciowy, przez który zmieści się zbiór danych.

Jakie rozmiary modeli mieszczą się na której karcie

Praktycznym ograniczeniem jest VRAM. Model o 7 miliardach parametrów skwantyzowany do 4 bitów mieści się swobodnie na karcie 16 GB i zostawia miejsce na użyteczne okno kontekstu; 13B chce 24 GB; model 70B przy tej samej kwantyzacji potrzebuje mniej więcej 40-48 GB albo dwóch kart. Serwowanie w pełnej precyzji 16-bitowej mniej więcej podwaja każdą z tych liczb.

Jeśli model się nie mieści, odpowiedzią jest kwantyzacja, mniejszy model albo kolejna karta - a nie zrzucanie do pamięci systemowej, które zamienia interaktywnego asystenta w zadanie wsadowe.

Oprogramowanie, którego naprawdę się używa

vLLM do serwowania o wysokiej przepustowości z endpointem zgodnym z OpenAI, Ollama gdy wygoda liczy się bardziej niż szczytowa liczba tokenów na sekundę, llama.cpp dla najmniejszego śladu i PyTorch bezpośrednio do wszystkiego szytego na miarę. Wszystkie instalują się tak samo jak na dowolnej maszynie z Ubuntu, bo dokładnie tym to jest.

Inferencja czy trening - potrzebują różnych maszyn

Inferencja jest wrażliwa na opóźnienia i ograniczona głównie przez VRAM i przepustowość pamięci: jedna karta, wystarczająco duża, i krótka droga do klienta. Działa bez przerwy, więc maszyna w abonamencie miesięcznym jest tańszym rozwiązaniem.

Trening i dostrajanie są ograniczone przepustowością i przychodzą zrywami. Chcą więcej kart, znacznie więcej pamięci systemowej i NVMe na tyle dużego, by zmieścić zbiór danych. Jeśli praca jest okazjonalna, dobierz rozmiar pod szczyt i oddaj maszynę zamiast płacić za bezczynny krzem.

Prywatna AI i to, gdzie leżą dane

Powodem, dla którego większość naszych klientów GPU jest tutaj, nie jest cena. Chodzi o to, że model działający na maszynie wynajętej w Pradze albo w Covilhã nie wysyła promptów stronie trzeciej, nie trenuje cudzego modelu na Twoich dokumentach i znajduje się w jurysdykcji, którą możesz wskazać w umowie powierzenia danych.

To ma znaczenie wszędzie tam, gdzie w grę wchodzą dane klientów, umowy, dane medyczne czy finansowe - przy obciążeniach, dla których publiczne API inferencji jest problemem zgodności, zanim będzie problemem technicznym.

Lokalizacje i jak zamówić

Maszyny GPU są fizyczne i budowane na zamówienie, więc czas realizacji jest dłuższy niż przy serwerze cloud - powiedz wsparciu, jaki model zamierzasz serwować i przy jakiej równoległości, a wskaże najmniejszą kartę, która to udźwignie, a nie największą dostępną w magazynie.

Obie lokalizacje Tier III mogą je hostować, a wybór idzie za Twoimi użytkownikami tak samo jak przy każdym innym serwerze.

FAQ

Często zadawane pytania

Czy dostaję całe GPU, czy jego część?

Całą kartę. Serwer GPU to dedykowana maszyna z podłączonym akceleratorem, wraz z CPU, RAM i NVMe potrzebnymi do jego zasilenia, a to zwykle decyduje o realnej przepustowości bardziej niż sama karta

Jakie rozmiary modeli mieszczą się na której karcie?

Ograniczeniem jest VRAM. Model o 7 miliardach parametrów skwantyzowany do 4 bitów mieści się swobodnie w 16 GB i zostawia miejsce na użyteczne okno kontekstu, 13B wymaga 24 GB, a model 70B przy tej samej kwantyzacji potrzebuje mniej więcej 40-48 GB albo dwóch kart. Serwowanie w pełnej precyzji 16-bitowej mniej więcej podwaja każdą z tych liczb

Jakie stosy serwujące są wspierane?

Wszystko, co działa na Ubuntu ze sterownikami NVIDIA: vLLM do serwowania o wysokiej przepustowości z endpointem zgodnym z OpenAI, Ollama gdy wygoda liczy się bardziej niż szczytowa przepustowość, llama.cpp dla najmniejszego śladu albo PyTorch bezpośrednio do pracy szytej na miarę

Czy serwer GPU lepiej nadaje się do inferencji, czy do treningu?

Potrzebują różnych maszyn. Inferencja jest ograniczona opóźnieniami i głównie przez VRAM, więc jedna wystarczająco duża karta pracująca w sposób ciągły jest tańszym rozwiązaniem. Trening i dostrajanie są ograniczone przepustowością i przychodzą zrywami - więcej kart, znacznie więcej pamięci systemowej i NVMe mieszczące zbiór danych

Gdzie trafiają moje dane, gdy uruchamiam tu model?

Donikąd. Model działa na maszynie, którą wynajmujesz w Pradze albo w Covilhã: prompty nie są wysyłane stronie trzeciej, nic nie służy trenowaniu cudzego modelu, a jurysdykcja jest taka, którą możesz wskazać w umowie powierzenia przetwarzania danych

Ile trwa otrzymanie takiego serwera?

Dłużej niż serwera cloud, bo maszyna jest fizyczna i budowana na zamówienie. Powiedz wsparciu, jaki model zamierzasz serwować i jakiej równoległości oczekujesz, a dobiorą najmniejszą kartę, która to udźwignie, zamiast największej dostępnej w magazynie

Jeśli potrzebujesz pomocy lub masz dodatkowe pytania, skontaktuj się z menedżerami lub napisz do zespołu wsparcia pod adresem support@dcxv.com