Serwer cloud dla Ollama w Europie: przewodnik samohostingu AI EU
Ollama to najszybszy sposob uruchomienia lokalnego LLM - jedna komenda instaluje środowisko uruchomieniowe, pobiera model i udostepnia API zgodne z OpenAI. Dla europejskich zespołów, uruchomienie Ollama na serwerze cloud UE oznacza, ze cala inferencja AI pozostaje pod jurysdykcja UE, spelniajac wymagania RODO.
Dlaczego warto uruchamiać Ollama na serwerze cloud UE
Hosting w UE jest wazny, poniewaz Ollama służy jako endpoint inferencji dla Twoich aplikacji. Każdy prompt wysłany przez użytkowników przechodzi przez ten serwer. Zgodnie z RODO, jesli te prompty zawieraja dane osobowe, inferencja musi odbywac sie na infrastrukturze pod jurysdykcja UE. Serwer cloud DCXV EU z Ollama zapewnia zgodny, prywatny endpoint AI.
Wybór odpowiedniego modelu
- llama3.1:8b - najlepszy ogolny dla czatu, podsumowania, Q&A. 4-5 GB VRAM przy Q4.
- llama3.1:70b - jakość bliska GPT-4. Wymaga 40+ GB VRAM.
- mistral:7b - szybki, wydajny, doskonaly do ustrukturyzowanych danych wyjsciowych.
- nomic-embed-text - model embeddingowy dla potoków RAG. 274 MB.
- codellama:13b - generowanie i przegląd kodu.
- phi3:mini - bardzo szybki na CPU, przydatny do klasyfikacji.
Minimalne specyfikacje dla Ollama
- Tylko CPU (male modele, 7B Q4) - 8 vCPU, 16 GB RAM, 100 GB NVMe SSD
- CPU produkcyjny (rownolegle zadania) - 16 vCPU, 32 GB RAM, 200 GB NVMe SSD
- GPU wejsciowy (7B-13B przy FP16) - 4 vCPU, 16 GB RAM, 16-24 GB VRAM
- GPU produkcyjny (modele 34B+) - 8 vCPU, 64 GB RAM, 40-80 GB VRAM
Rekomendowana konfiguracja DCXV
Serwery cloud DCXV dzialaja na infrastrukturze Tier III w UE:
- Serwer CPU, 16 vCPU / 32 GB RAM - obsluguje modele 7B z szybkoscia 18-28 tokenów/s
- Serwer GPU, 16-24 GB VRAM - obsluguje modele 7B-13B z szybkoscia 80-120 tokenów/s
- Serwer GPU, 80 GB VRAM - obsluguje modele 70B z szybkoscia 25-40 tokenów/s
Skontaktuj sie z sales@dcxv.com w sprawie instancji GPU lub CPU.
Komendy szybkiej konfiguracji
# Instalacja Ollama na Ubuntu 22.04
curl -fsSL https://ollama.com/install.sh | sh
# Pobieranie modeli
ollama pull llama3.1:8b
ollama pull mistral:7b
ollama pull nomic-embed-text
ollama list
# Konfiguracja Ollama dla sieci prywatnej
# /etc/systemd/system/ollama.service:
# Environment="OLLAMA_HOST=0.0.0.0:11434"
# Environment="OLLAMA_NUM_PARALLEL=4"
sudo systemctl daemon-reload && sudo systemctl restart ollama
curl http://10.0.0.5:11434/api/tags
# Korzystanie z API zgodnego z OpenAI
curl http://10.0.0.5:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "llama3.1:8b",
"messages": [{"role": "user", "content": "Co to jest RODO?"}]
}'
Którą kwantyzację pobrać
Każdy model powyżej ma kilka wersji, a tag decyduje, ile zostaje z oryginalnych wag. ollama pull llama3.1:8b daje Q4_K_M - te 4,7 GB z poleceń powyżej - i ten domyślny wybór częściej ma rację, niż jej nie ma:
| Wersja | Model 8B potrzebuje | Z czego rezygnujesz | Pobierz ją, gdy |
|---|---|---|---|
| Q4_K_M | około 4,7 GB | Niewiele, co widać w czacie czy przy streszczaniu | To domyślna wersja i słuszna do większości zadań |
| Q5_K_M | około 5,7 GB | Prawie nic, co byś zauważył | Pamięć jest wolna i chcesz ją wykorzystać |
| Q8_0 | około 8,5 GB | Nic, co warto nazwać | Wyjście strukturalne, które musi się parsować za każdym razem |
| fp16 | około 16 GB | Nic, to oryginalne wagi | Porównujesz z punktem odniesienia albo dostrajasz model |
Planować trzeba nie rozmiarem pliku, a rozmiarem pliku plus oknem kontekstu. Model 4,7 GB z kontekstem 32k może poprosić o kolejne dwa lub trzy gigabajty na cache KV, i tak model 7B na maszynie, gdzie "16 GB wystarczy", zaczyna korzystać ze swapu.
Oczekiwana wydajność
CPU (16 vCPU), llama3.1:8b Q4_K_M:
- Generacja (jedno zadanie) - 18-28 tokenów/s
- Przepustowosc embeddingów - 250-400 wektorów/s
GPU (16 GB VRAM), llama3.1:8b FP16:
- Generacja (jedno zadanie) - 80-120 tokenów/s
- Czas do pierwszego tokena - 100-250 ms
To oczekiwania dla sprzętu tej klasy, a nie pomiary z naszego laboratorium. Traktuj je jako punkt wyjścia do doboru rozmiaru i zmierz własne obciążenie: realne liczby zależą od twoich danych, zapytań i tuningu znacznie bardziej niż od dostawcy.
Podsumowanie
Ollama na serwerze cloud DCXV EU daje Twojemu zespolowi prywatny, zgodny z RODO endpoint AI. Instalacja zajmuje mniej niz pięć minut.
