Serwer cloud dla hostingu LLM w Europie: przewodnik AI RODO

Serwer cloud dla hostingu LLM w Europie: przewodnik AI RODO

Serwer cloud dla hostingu LLM w Europie: przewodnik AI RODO

Samodzielny hosting duzego modelu jezykowego daje pełna kontrole nad tym, jakie dane trafiaja do modelu, gdzie sa przetwarzane i kto ma do nich dostęp. Dla europejskich firm nie jest to tylko argument kosztowy - to wymog zgodności. Każdy prompt zawierajacy dane osobowe mieszkańców UE musi być przetwarzany pod jurysdykcja UE zgodnie z RODO.

Dlaczego jurysdykcja UE ma znaczenie dla hostingu LLM

Gdy użytkownicy wchodza w interakcje z LLM - zadajac pytania, podsumowujac dokumenty - te prompty często zawieraja imiona, adresy e-mail i inne dane osobowe. Wysylanie ich do API hostowanego w USA oznacza, ze dane osobowe opuszczaja jurysdykcje UE przy każdym zadaniu.

Samodzielny hosting na serwerze cloud DCXV w UE oznacza, ze cala inferencja pozostaje w granicach UE. Dla aplikacji zdrowotnych, prawnych i finansowych w Europie, samodzielna infrastruktura LLM w UE jest praktyczna droga do zgodności z RODO.

Wybór rozmiaru modelu i kwantyzacji

  • Modele 7B (Q4, ~4 GB VRAM) - streszczenie, klasyfikacja, Q&A dla dokumentów
  • Modele 13B (Q4, ~8 GB VRAM) - lepsze rozumowanie, lepsze przestrzeganie instrukcji
  • Modele 34B (Q4, ~20 GB VRAM) - jakość bliska GPT-3.5
  • Modele 70B (Q4, ~40 GB VRAM) - klasa GPT-4 dla wielu zadan

Minimalne specyfikacje dla hostingu LLM

  • Serwowanie CPU (7B Q4) - 16 vCPU, 32 GB RAM, 200 GB NVMe SSD
  • GPU wejsciowy (7B-13B, RTX 4090) - 8 vCPU, 32 GB RAM, 24 GB VRAM, 500 GB NVMe
  • GPU średni (34B Q4, A100 40 GB) - 16 vCPU, 64 GB RAM, 40 GB VRAM, 1 TB NVMe
  • GPU wysoki (70B Q4, A100 80 GB) - 16 vCPU, 128 GB RAM, 80 GB VRAM, 2 TB NVMe

Rekomendowana konfiguracja DCXV

Serwery cloud DCXV zapewniaja serwery EU wyposezone w GPU do hostingu LLM:

  • Serwer GPU, 24 GB VRAM - modele 7B-13B dla kopilotów SaaS
  • Serwer GPU, 80 GB VRAM - modele 70B dla produkcyjnych API
  • Serwer CPU, 32-64 GB RAM - modele 7B via llama.cpp do przetwarzania w tle

Skontaktuj sie z sales@dcxv.com w sprawie dostępności GPU.

Komendy szybkiej konfiguracji

# Opcja 1: Ollama (najprostsza)
curl -fsSL https://ollama.com/install.sh | sh
sudo systemctl enable --now ollama
ollama pull llama3.1:8b

# Udostępnij w sieci prywatnej:
# Environment="OLLAMA_HOST=0.0.0.0:11434"
sudo systemctl daemon-reload && sudo systemctl restart ollama
# Opcja 2: vLLM dla GPU o duzej przepustowości
pip install vllm

python -m vllm.entrypoints.openai.api_server \
  --model meta-llama/Llama-3.1-8B-Instruct \
  --host 10.0.0.5 --port 8000 \
  --gpu-memory-utilization 0.90

Które środowisko serwowania wybrać

Polecenia powyżej pokazują dwa sposoby serwowania tych samych wag, a wybór nie dotyczy jakości - wszystkie uruchamiają ten sam model. Dotyczy tego, co się stanie, gdy drugie żądanie przyjdzie przed zakończeniem pierwszego:

Środowisko Równoległe żądania Gdzie działa najlepiej Wybierz je, gdy
Ollama W kolejce, po jednym CPU lub jeden GPU Narzędzia wewnętrzne, jeden użytkownik, najszybszy start
llama.cpp W kolejce, z małą partią CPU, wagi GGUF Brak GPU w ogóle albo nocne przetwarzanie wsadowe
vLLM Ciągłe grupowanie w partie Tylko GPU Wielu użytkowników dzieli jeden GPU i liczy się przepustowość
TGI Ciągłe grupowanie w partie Tylko GPU Pracujesz już na stosie Hugging Face

Różnica jest większa, niż wygląda. GPU obsługujący jedno żądanie naraz większość czasu czeka na pamięć, więc środowisko grupujące żądania może obsłużyć kilka razy więcej użytkowników na tej samej karcie bez żadnej zmiany w modelu. Dlatego liczby dla CPU i dla GPU poniżej nie są tym samym pomiarem przeskalowanym, a pracą o innym kształcie.

Oczekiwana wydajność

vLLM na RTX 4090, Llama 3.1 8B FP16:

  • Generacja (jedno zadanie) - 80-120 tokenów/s
  • Przepustowosc wsadowa (8 rownoczesnych) - 400-700 tokenów/s
  • Czas do pierwszego tokena - 150-300 ms

To oczekiwania dla sprzętu tej klasy, a nie pomiary z naszego laboratorium. Traktuj je jako punkt wyjścia do doboru rozmiaru i zmierz własne obciążenie: realne liczby zależą od twoich danych, zapytań i tuningu znacznie bardziej niż od dostawcy.

Podsumowanie

Samodzielny hosting LLM na infrastrukturze UE jest najbardziej niezawodna droga do zgodnej z RODO AI w produkcji.

Jak połączyć się z nowym serwerem cloud przez SSH
sshtutorialcloud

Jak połączyć się z nowym serwerem cloud przez SSH

Serwer jest gotowy, a panel pokazuje IP, login i hasło. Oto pierwsze połączenie SSH, cztery najczęstsze błędy i pierwsze dziesięć minut.

Jak połączyć się z serwerem Windows przez pulpit zdalny
rdpwindowstutorialcloud

Jak połączyć się z serwerem Windows przez pulpit zdalny

Masz adres, nazwę użytkownika i hasło. Oto jak zamienić je w pulpit Windows na swoim ekranie - z komputera, Maca albo telefonu, krok po kroku.

Serwer cloud dla Stable Diffusion w Europie: konfiguracja GPU
cloudaigpu

Serwer cloud dla Stable Diffusion w Europie: konfiguracja GPU

Uruchom Stable Diffusion na serwerze cloud w UE zgodnym z RODO. GPU, konfiguracja AUTOMATIC1111 i ComfyUI, przechowywanie modeli i testy generowania obrazów.

Serwer cloud dla hostingu LLM w Europie: przewodnik AI RODO
cloudaigpu

Serwer cloud dla hostingu LLM w Europie: przewodnik AI RODO

Hostuj duze modele jezykowe na serwerze cloud w UE zgodnym z RODO. Wymagania GPU, kwantyzacja, frameworki API i testy wydajności dla Europy.

Uruchom Claude Code, Codex i Grok CLI na własnym serwerze cloud
cloudaivps

Uruchom Claude Code, Codex i Grok CLI na własnym serwerze cloud

Zamień serwer cloud Debian lub Ubuntu w piaskownicę dla agentów AI jak Claude Code, Codex i Grok CLI. Koduj z dowolnego miejsca, nawet z telefonu.