Serwer cloud dla hostingu LLM w Europie: przewodnik AI RODO
Samodzielny hosting duzego modelu jezykowego daje pełna kontrole nad tym, jakie dane trafiaja do modelu, gdzie sa przetwarzane i kto ma do nich dostęp. Dla europejskich firm nie jest to tylko argument kosztowy - to wymog zgodności. Każdy prompt zawierajacy dane osobowe mieszkańców UE musi być przetwarzany pod jurysdykcja UE zgodnie z RODO.
Dlaczego jurysdykcja UE ma znaczenie dla hostingu LLM
Gdy użytkownicy wchodza w interakcje z LLM - zadajac pytania, podsumowujac dokumenty - te prompty często zawieraja imiona, adresy e-mail i inne dane osobowe. Wysylanie ich do API hostowanego w USA oznacza, ze dane osobowe opuszczaja jurysdykcje UE przy każdym zadaniu.
Samodzielny hosting na serwerze cloud DCXV w UE oznacza, ze cala inferencja pozostaje w granicach UE. Dla aplikacji zdrowotnych, prawnych i finansowych w Europie, samodzielna infrastruktura LLM w UE jest praktyczna droga do zgodności z RODO.
Wybór rozmiaru modelu i kwantyzacji
- Modele 7B (Q4, ~4 GB VRAM) - streszczenie, klasyfikacja, Q&A dla dokumentów
- Modele 13B (Q4, ~8 GB VRAM) - lepsze rozumowanie, lepsze przestrzeganie instrukcji
- Modele 34B (Q4, ~20 GB VRAM) - jakość bliska GPT-3.5
- Modele 70B (Q4, ~40 GB VRAM) - klasa GPT-4 dla wielu zadan
Minimalne specyfikacje dla hostingu LLM
- Serwowanie CPU (7B Q4) - 16 vCPU, 32 GB RAM, 200 GB NVMe SSD
- GPU wejsciowy (7B-13B, RTX 4090) - 8 vCPU, 32 GB RAM, 24 GB VRAM, 500 GB NVMe
- GPU średni (34B Q4, A100 40 GB) - 16 vCPU, 64 GB RAM, 40 GB VRAM, 1 TB NVMe
- GPU wysoki (70B Q4, A100 80 GB) - 16 vCPU, 128 GB RAM, 80 GB VRAM, 2 TB NVMe
Rekomendowana konfiguracja DCXV
Serwery cloud DCXV zapewniaja serwery EU wyposezone w GPU do hostingu LLM:
- Serwer GPU, 24 GB VRAM - modele 7B-13B dla kopilotów SaaS
- Serwer GPU, 80 GB VRAM - modele 70B dla produkcyjnych API
- Serwer CPU, 32-64 GB RAM - modele 7B via llama.cpp do przetwarzania w tle
Skontaktuj sie z sales@dcxv.com w sprawie dostępności GPU.
Komendy szybkiej konfiguracji
# Opcja 1: Ollama (najprostsza)
curl -fsSL https://ollama.com/install.sh | sh
sudo systemctl enable --now ollama
ollama pull llama3.1:8b
# Udostępnij w sieci prywatnej:
# Environment="OLLAMA_HOST=0.0.0.0:11434"
sudo systemctl daemon-reload && sudo systemctl restart ollama
# Opcja 2: vLLM dla GPU o duzej przepustowości
pip install vllm
python -m vllm.entrypoints.openai.api_server \
--model meta-llama/Llama-3.1-8B-Instruct \
--host 10.0.0.5 --port 8000 \
--gpu-memory-utilization 0.90
Które środowisko serwowania wybrać
Polecenia powyżej pokazują dwa sposoby serwowania tych samych wag, a wybór nie dotyczy jakości - wszystkie uruchamiają ten sam model. Dotyczy tego, co się stanie, gdy drugie żądanie przyjdzie przed zakończeniem pierwszego:
| Środowisko | Równoległe żądania | Gdzie działa najlepiej | Wybierz je, gdy |
|---|---|---|---|
| Ollama | W kolejce, po jednym | CPU lub jeden GPU | Narzędzia wewnętrzne, jeden użytkownik, najszybszy start |
| llama.cpp | W kolejce, z małą partią | CPU, wagi GGUF | Brak GPU w ogóle albo nocne przetwarzanie wsadowe |
| vLLM | Ciągłe grupowanie w partie | Tylko GPU | Wielu użytkowników dzieli jeden GPU i liczy się przepustowość |
| TGI | Ciągłe grupowanie w partie | Tylko GPU | Pracujesz już na stosie Hugging Face |
Różnica jest większa, niż wygląda. GPU obsługujący jedno żądanie naraz większość czasu czeka na pamięć, więc środowisko grupujące żądania może obsłużyć kilka razy więcej użytkowników na tej samej karcie bez żadnej zmiany w modelu. Dlatego liczby dla CPU i dla GPU poniżej nie są tym samym pomiarem przeskalowanym, a pracą o innym kształcie.
Oczekiwana wydajność
vLLM na RTX 4090, Llama 3.1 8B FP16:
- Generacja (jedno zadanie) - 80-120 tokenów/s
- Przepustowosc wsadowa (8 rownoczesnych) - 400-700 tokenów/s
- Czas do pierwszego tokena - 150-300 ms
To oczekiwania dla sprzętu tej klasy, a nie pomiary z naszego laboratorium. Traktuj je jako punkt wyjścia do doboru rozmiaru i zmierz własne obciążenie: realne liczby zależą od twoich danych, zapytań i tuningu znacznie bardziej niż od dostawcy.
Podsumowanie
Samodzielny hosting LLM na infrastrukturze UE jest najbardziej niezawodna droga do zgodnej z RODO AI w produkcji.
