Serwer cloud dla Ollama w Europie: przewodnik samohostingu AI EU

Serwer cloud dla Ollama w Europie: przewodnik samohostingu AI EU

Serwer cloud dla Ollama w Europie: przewodnik samohostingu AI EU

Ollama to najszybszy sposob uruchomienia lokalnego LLM - jedna komenda instaluje środowisko uruchomieniowe, pobiera model i udostepnia API zgodne z OpenAI. Dla europejskich zespołów, uruchomienie Ollama na serwerze cloud UE oznacza, ze cala inferencja AI pozostaje pod jurysdykcja UE, spelniajac wymagania RODO.

Dlaczego warto uruchamiać Ollama na serwerze cloud UE

Hosting w UE jest wazny, poniewaz Ollama służy jako endpoint inferencji dla Twoich aplikacji. Każdy prompt wysłany przez użytkowników przechodzi przez ten serwer. Zgodnie z RODO, jesli te prompty zawieraja dane osobowe, inferencja musi odbywac sie na infrastrukturze pod jurysdykcja UE. Serwer cloud DCXV EU z Ollama zapewnia zgodny, prywatny endpoint AI.

Wybór odpowiedniego modelu

  • llama3.1:8b - najlepszy ogolny dla czatu, podsumowania, Q&A. 4-5 GB VRAM przy Q4.
  • llama3.1:70b - jakość bliska GPT-4. Wymaga 40+ GB VRAM.
  • mistral:7b - szybki, wydajny, doskonaly do ustrukturyzowanych danych wyjsciowych.
  • nomic-embed-text - model embeddingowy dla potoków RAG. 274 MB.
  • codellama:13b - generowanie i przegląd kodu.
  • phi3:mini - bardzo szybki na CPU, przydatny do klasyfikacji.

Minimalne specyfikacje dla Ollama

  • Tylko CPU (male modele, 7B Q4) - 8 vCPU, 16 GB RAM, 100 GB NVMe SSD
  • CPU produkcyjny (rownolegle zadania) - 16 vCPU, 32 GB RAM, 200 GB NVMe SSD
  • GPU wejsciowy (7B-13B przy FP16) - 4 vCPU, 16 GB RAM, 16-24 GB VRAM
  • GPU produkcyjny (modele 34B+) - 8 vCPU, 64 GB RAM, 40-80 GB VRAM

Rekomendowana konfiguracja DCXV

Serwery cloud DCXV dzialaja na infrastrukturze Tier III w UE:

  • Serwer CPU, 16 vCPU / 32 GB RAM - obsluguje modele 7B z szybkoscia 18-28 tokenów/s
  • Serwer GPU, 16-24 GB VRAM - obsluguje modele 7B-13B z szybkoscia 80-120 tokenów/s
  • Serwer GPU, 80 GB VRAM - obsluguje modele 70B z szybkoscia 25-40 tokenów/s

Skontaktuj sie z sales@dcxv.com w sprawie instancji GPU lub CPU.

Komendy szybkiej konfiguracji

# Instalacja Ollama na Ubuntu 22.04
curl -fsSL https://ollama.com/install.sh | sh

# Pobieranie modeli
ollama pull llama3.1:8b
ollama pull mistral:7b
ollama pull nomic-embed-text
ollama list
# Konfiguracja Ollama dla sieci prywatnej
# /etc/systemd/system/ollama.service:
# Environment="OLLAMA_HOST=0.0.0.0:11434"
# Environment="OLLAMA_NUM_PARALLEL=4"

sudo systemctl daemon-reload && sudo systemctl restart ollama
curl http://10.0.0.5:11434/api/tags
# Korzystanie z API zgodnego z OpenAI
curl http://10.0.0.5:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "llama3.1:8b",
    "messages": [{"role": "user", "content": "Co to jest RODO?"}]
  }'

Którą kwantyzację pobrać

Każdy model powyżej ma kilka wersji, a tag decyduje, ile zostaje z oryginalnych wag. ollama pull llama3.1:8b daje Q4_K_M - te 4,7 GB z poleceń powyżej - i ten domyślny wybór częściej ma rację, niż jej nie ma:

Wersja Model 8B potrzebuje Z czego rezygnujesz Pobierz ją, gdy
Q4_K_M około 4,7 GB Niewiele, co widać w czacie czy przy streszczaniu To domyślna wersja i słuszna do większości zadań
Q5_K_M około 5,7 GB Prawie nic, co byś zauważył Pamięć jest wolna i chcesz ją wykorzystać
Q8_0 około 8,5 GB Nic, co warto nazwać Wyjście strukturalne, które musi się parsować za każdym razem
fp16 około 16 GB Nic, to oryginalne wagi Porównujesz z punktem odniesienia albo dostrajasz model

Planować trzeba nie rozmiarem pliku, a rozmiarem pliku plus oknem kontekstu. Model 4,7 GB z kontekstem 32k może poprosić o kolejne dwa lub trzy gigabajty na cache KV, i tak model 7B na maszynie, gdzie "16 GB wystarczy", zaczyna korzystać ze swapu.

Oczekiwana wydajność

CPU (16 vCPU), llama3.1:8b Q4_K_M:

  • Generacja (jedno zadanie) - 18-28 tokenów/s
  • Przepustowosc embeddingów - 250-400 wektorów/s

GPU (16 GB VRAM), llama3.1:8b FP16:

  • Generacja (jedno zadanie) - 80-120 tokenów/s
  • Czas do pierwszego tokena - 100-250 ms

To oczekiwania dla sprzętu tej klasy, a nie pomiary z naszego laboratorium. Traktuj je jako punkt wyjścia do doboru rozmiaru i zmierz własne obciążenie: realne liczby zależą od twoich danych, zapytań i tuningu znacznie bardziej niż od dostawcy.

Podsumowanie

Ollama na serwerze cloud DCXV EU daje Twojemu zespolowi prywatny, zgodny z RODO endpoint AI. Instalacja zajmuje mniej niz pięć minut.

Jak połączyć się z nowym serwerem cloud przez SSH
sshtutorialcloud

Jak połączyć się z nowym serwerem cloud przez SSH

Serwer jest gotowy, a panel pokazuje IP, login i hasło. Oto pierwsze połączenie SSH, cztery najczęstsze błędy i pierwsze dziesięć minut.

Jak połączyć się z serwerem Windows przez pulpit zdalny
rdpwindowstutorialcloud

Jak połączyć się z serwerem Windows przez pulpit zdalny

Masz adres, nazwę użytkownika i hasło. Oto jak zamienić je w pulpit Windows na swoim ekranie - z komputera, Maca albo telefonu, krok po kroku.

Serwer cloud dla Stable Diffusion w Europie: konfiguracja GPU
cloudaigpu

Serwer cloud dla Stable Diffusion w Europie: konfiguracja GPU

Uruchom Stable Diffusion na serwerze cloud w UE zgodnym z RODO. GPU, konfiguracja AUTOMATIC1111 i ComfyUI, przechowywanie modeli i testy generowania obrazów.

Serwer cloud dla hostingu LLM w Europie: przewodnik AI RODO
cloudaigpu

Serwer cloud dla hostingu LLM w Europie: przewodnik AI RODO

Hostuj duze modele jezykowe na serwerze cloud w UE zgodnym z RODO. Wymagania GPU, kwantyzacja, frameworki API i testy wydajności dla Europy.

Uruchom Claude Code, Codex i Grok CLI na własnym serwerze cloud
cloudaivps

Uruchom Claude Code, Codex i Grok CLI na własnym serwerze cloud

Zamień serwer cloud Debian lub Ubuntu w piaskownicę dla agentów AI jak Claude Code, Codex i Grok CLI. Koduj z dowolnego miejsca, nawet z telefonu.