Proponujemy
Nasze przystępne ceny
Tylko markowy sprzęt, pełna kontrola, bez limitów ruchu, bez niespodzianek!
Serwery GPU NVIDIA do AI, uczenia maszynowego i renderowania w centrach danych Tier III w UE
Tylko markowy sprzęt, pełna kontrola, bez limitów ruchu, bez niespodzianek!
Infrastruktura klasy korporacyjnej z gwarancją 99,9% dostępności w lokalizacjach UE
Uruchom swoje serwery i zasoby online w ciągu godzin, nie dni. Bez opłaty za instalację
Operacje zgodne z GDPR ze wszystkimi danymi przechowywanymi w europejskich centrach danych
Serwer GPU to dedykowana maszyna z jednym lub kilkoma akceleratorami, w naszych europejskich szafach. Dostajesz całą kartę - nie jej ułamek dzielony w czasie - wraz z CPU, RAM i NVMe potrzebnymi, by ją nakarmić, a to zwykle decyduje o realnej przepustowości.
Dostępne karty zmieniają się wraz z dostawami, więc uczciwą listą jest strona konfiguracji, a nie sztywna tabela w tym tekście. Nie zmienia się natomiast kształt: dość pamięci systemowej, by utrzymać model podczas ładowania, NVMe na tyle szybkie, żeby wczytywanie danych nie było wąskim gardłem, i port sieciowy, przez który zmieści się zbiór danych.
Praktycznym ograniczeniem jest VRAM. Model o 7 miliardach parametrów skwantyzowany do 4 bitów mieści się swobodnie na karcie 16 GB i zostawia miejsce na użyteczne okno kontekstu; 13B chce 24 GB; model 70B przy tej samej kwantyzacji potrzebuje mniej więcej 40-48 GB albo dwóch kart. Serwowanie w pełnej precyzji 16-bitowej mniej więcej podwaja każdą z tych liczb.
Jeśli model się nie mieści, odpowiedzią jest kwantyzacja, mniejszy model albo kolejna karta - a nie zrzucanie do pamięci systemowej, które zamienia interaktywnego asystenta w zadanie wsadowe.
vLLM do serwowania o wysokiej przepustowości z endpointem zgodnym z OpenAI, Ollama gdy wygoda liczy się bardziej niż szczytowa liczba tokenów na sekundę, llama.cpp dla najmniejszego śladu i PyTorch bezpośrednio do wszystkiego szytego na miarę. Wszystkie instalują się tak samo jak na dowolnej maszynie z Ubuntu, bo dokładnie tym to jest.
Inferencja jest wrażliwa na opóźnienia i ograniczona głównie przez VRAM i przepustowość pamięci: jedna karta, wystarczająco duża, i krótka droga do klienta. Działa bez przerwy, więc maszyna w abonamencie miesięcznym jest tańszym rozwiązaniem.
Trening i dostrajanie są ograniczone przepustowością i przychodzą zrywami. Chcą więcej kart, znacznie więcej pamięci systemowej i NVMe na tyle dużego, by zmieścić zbiór danych. Jeśli praca jest okazjonalna, dobierz rozmiar pod szczyt i oddaj maszynę zamiast płacić za bezczynny krzem.
Powodem, dla którego większość naszych klientów GPU jest tutaj, nie jest cena. Chodzi o to, że model działający na maszynie wynajętej w Pradze albo w Covilhã nie wysyła promptów stronie trzeciej, nie trenuje cudzego modelu na Twoich dokumentach i znajduje się w jurysdykcji, którą możesz wskazać w umowie powierzenia danych.
To ma znaczenie wszędzie tam, gdzie w grę wchodzą dane klientów, umowy, dane medyczne czy finansowe - przy obciążeniach, dla których publiczne API inferencji jest problemem zgodności, zanim będzie problemem technicznym.
Maszyny GPU są fizyczne i budowane na zamówienie, więc czas realizacji jest dłuższy niż przy serwerze cloud - powiedz wsparciu, jaki model zamierzasz serwować i przy jakiej równoległości, a wskaże najmniejszą kartę, która to udźwignie, a nie największą dostępną w magazynie.
Obie lokalizacje Tier III mogą je hostować, a wybór idzie za Twoimi użytkownikami tak samo jak przy każdym innym serwerze.
Często zadawane pytania
Całą kartę. Serwer GPU to dedykowana maszyna z podłączonym akceleratorem, wraz z CPU, RAM i NVMe potrzebnymi do jego zasilenia, a to zwykle decyduje o realnej przepustowości bardziej niż sama karta
Ograniczeniem jest VRAM. Model o 7 miliardach parametrów skwantyzowany do 4 bitów mieści się swobodnie w 16 GB i zostawia miejsce na użyteczne okno kontekstu, 13B wymaga 24 GB, a model 70B przy tej samej kwantyzacji potrzebuje mniej więcej 40-48 GB albo dwóch kart. Serwowanie w pełnej precyzji 16-bitowej mniej więcej podwaja każdą z tych liczb
Wszystko, co działa na Ubuntu ze sterownikami NVIDIA: vLLM do serwowania o wysokiej przepustowości z endpointem zgodnym z OpenAI, Ollama gdy wygoda liczy się bardziej niż szczytowa przepustowość, llama.cpp dla najmniejszego śladu albo PyTorch bezpośrednio do pracy szytej na miarę
Potrzebują różnych maszyn. Inferencja jest ograniczona opóźnieniami i głównie przez VRAM, więc jedna wystarczająco duża karta pracująca w sposób ciągły jest tańszym rozwiązaniem. Trening i dostrajanie są ograniczone przepustowością i przychodzą zrywami - więcej kart, znacznie więcej pamięci systemowej i NVMe mieszczące zbiór danych
Donikąd. Model działa na maszynie, którą wynajmujesz w Pradze albo w Covilhã: prompty nie są wysyłane stronie trzeciej, nic nie służy trenowaniu cudzego modelu, a jurysdykcja jest taka, którą możesz wskazać w umowie powierzenia przetwarzania danych
Dłużej niż serwera cloud, bo maszyna jest fizyczna i budowana na zamówienie. Powiedz wsparciu, jaki model zamierzasz serwować i jakiej równoległości oczekujesz, a dobiorą najmniejszą kartę, która to udźwignie, zamiast największej dostępnej w magazynie
Jeśli potrzebujesz pomocy lub masz dodatkowe pytania, skontaktuj się z menedżerami lub napisz do zespołu wsparcia pod adresem support@dcxv.com