Cloud-Server für Ollama in Europa: Self-Host-KI-EU-Leitfaden

Cloud-Server für Ollama in Europa: Self-Host-KI-EU-Leitfaden

Cloud-Server für Ollama in Europa: Self-Host-KI-EU-Leitfaden

Ollama ist der schnellste Weg, ein lokales LLM zum Laufen zu bringen - ein einziger Befehl installiert die Runtime, ladt ein Modell herunter und stellt eine OpenAI-kompatible API bereit. Für europäische Teams bedeutet das Ausführen von Ollama auf einem EU-Cloud-Server, dass alle KI-Inferenz unter EU-Gerichtsbarkeit bleibt und DSGVO-Anforderungen erfüllt werden.

Warum Ollama auf einem EU-Cloud-Server ausführen

EU-Hosting ist wichtig, weil Ollama als Inferenz-Endpunkt für Ihre Anwendungen dient. Jeder Prompt, den Ihre Nutzer senden, läuft durch diesen Server. Gemas DSGVO muss diese Inferenz auf Infrastruktur unter EU-Gerichtsbarkeit stattfinden. Ein DCXV EU-Cloud-Server mit Ollama gibt Ihnen einen konformen, privaten KI-Endpunkt.

Das richtige Modell wählen

  • llama3.1:8b - bestes Allroundmodell für Chat, Zusammenfassung, Q&A. 4-5 GB VRAM bei Q4.
  • llama3.1:70b - nähe GPT-4-Qualität. Benötigt 40+ GB VRAM.
  • mistral:7b - schnell, effizient, hervorragend für strukturierte Ausgaben.
  • nomic-embed-text - Embedding-Modell für RAG-Pipelines. 274 MB.
  • codellama:13b - Code-Generierung und -Uberprufung.
  • phi3:mini - sehr schnell auf CPU, nützlich für Klassifizierung.

Mindestanforderungen für Ollama

  • Nur CPU (kleine Modelle, 7B Q4) - 8 vCPU, 16 GB RAM, 100 GB NVMe SSD
  • CPU Produktion (parallele Anfragen) - 16 vCPU, 32 GB RAM, 200 GB NVMe SSD
  • GPU Einstieg (7B-13B bei FP16) - 4 vCPU, 16 GB RAM, 16-24 GB VRAM
  • GPU Produktion (34B+ Modelle) - 8 vCPU, 64 GB RAM, 40-80 GB VRAM

Empfohlene DCXV-Konfiguration

DCXV Cloud-Server laufen auf Tier-III-EU-Infrastruktur:

  • CPU-Server, 16 vCPU / 32 GB RAM - bedient 7B-Modelle mit 18-28 Token/s
  • GPU-Server, 16-24 GB VRAM - bedient 7B-13B-Modelle mit 80-120 Token/s
  • GPU-Server, 80 GB VRAM - bedient 70B-Modelle mit 25-40 Token/s

Kontaktieren Sie sales@dcxv.com für GPU- oder CPU-Instanzen.

Schnell-Setup-Befehle

# Ollama auf Ubuntu 22.04 installieren
curl -fsSL https://ollama.com/install.sh | sh

# Modelle herunterladen
ollama pull llama3.1:8b
ollama pull mistral:7b
ollama pull nomic-embed-text
ollama list
# Ollama für privates Netzwerk konfigurieren
# /etc/systemd/system/ollama.service:
# Environment="OLLAMA_HOST=0.0.0.0:11434"
# Environment="OLLAMA_NUM_PARALLEL=4"

sudo systemctl daemon-reload && sudo systemctl restart ollama
curl http://10.0.0.5:11434/api/tags
# OpenAI-kompatible API verwenden
curl http://10.0.0.5:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "llama3.1:8b",
    "messages": [{"role": "user", "content": "Was ist DSGVO?"}]
  }'

Welche Quantisierung Sie ziehen sollten

Jedes Modell oben gibt es in mehreren Builds, und der Tag entscheidet, wie viel von den ursprünglichen Gewichten übrig bleibt. ollama pull llama3.1:8b liefert Q4_K_M - die 4,7 GB aus den Befehlen oben - und diese Voreinstellung ist häufiger richtig als nicht:

Build Ein 8B-Modell braucht Worauf Sie verzichten Ziehen Sie es, wenn
Q4_K_M etwa 4,7 GB Kaum etwas, das im Chat oder beim Zusammenfassen auffällt Die Voreinstellung, und für die meiste Arbeit richtig
Q5_K_M etwa 5,7 GB Fast nichts, was Sie bemerken würden Der Speicher ist frei und Sie wollen ihn nutzen
Q8_0 etwa 8,5 GB Nichts, was einen Namen verdient Strukturierte Ausgaben, die jedes Mal parsen müssen
fp16 etwa 16 GB Nichts, das sind die Originalgewichte Vergleich mit einer Baseline oder Fine-Tuning

Planen sollten Sie nicht mit der Dateigröße, sondern mit der Dateigröße plus Kontextfenster. Ein 4,7-GB-Modell mit 32k Kontext kann weitere zwei bis drei Gigabyte für den KV-Cache verlangen, und genau so landet ein 7B-Modell auf einer Maschine, bei der "16 GB reichen doch", im Auslagern.

Erwartete Leistungswerte

CPU (16 vCPU), llama3.1:8b Q4_K_M:

  • Einzelanfrage-Generierung - 18-28 Token/s
  • Embedding-Durchsatz - 250-400 Vektoren/s

GPU (16 GB VRAM), llama3.1:8b FP16:

  • Einzelanfrage-Generierung - 80-120 Token/s
  • Zeit bis zum ersten Token - 100-250 ms

Das sind Erwartungen für Hardware dieser Klasse, keine Messungen aus unserem Labor. Nehmen Sie sie als Ausgangspunkt für die Dimensionierung und messen Sie Ihre eigene Last: die echten Zahlen hängen von Ihren Daten, Ihren Abfragen und Ihrem Tuning weit mehr ab als vom Anbieter.

Fazit

Ollama auf einem DCXV EU-Cloud-Server gibt Ihrem Team einen privaten, DSGVO-konformen KI-Endpunkt. Die Installation dauert unter fünf Minuten.

So verbinden Sie sich per SSH mit Ihrem neuen Cloud-Server
sshtutorialcloud

So verbinden Sie sich per SSH mit Ihrem neuen Cloud-Server

Der Server ist bereit, die Konsole zeigt IP, Login und Passwort. Hier sind die erste SSH-Verbindung, die vier häufigsten Fehler und die ersten zehn Minuten.

So verbinden Sie sich per Remotedesktop mit einem Windows-Server
rdpwindowstutorialcloud

So verbinden Sie sich per Remotedesktop mit einem Windows-Server

Sie haben Adresse, Benutzername und Passwort. So wird daraus ein Windows-Desktop auf Ihrem Bildschirm - vom PC, Mac oder Telefon aus, Schritt für Schritt.

Cloud-Server für Stable Diffusion in Europa: GPU-Setup-Leitfaden
cloudaigpu

Cloud-Server für Stable Diffusion in Europa: GPU-Setup-Leitfaden

Stable Diffusion auf einem DSGVO-konformen EU-Cloud-Server betreiben. GPU-Anforderungen, AUTOMATIC1111- und ComfyUI-Setup, Modellspeicher und Benchmarks.

Cloud-Server für LLM-Hosting in Europa: DSGVO-KI-Leitfaden
cloudaigpu

Cloud-Server für LLM-Hosting in Europa: DSGVO-KI-Leitfaden

Grosse Sprachmodelle auf einem DSGVO-konformen EU-Cloud-Server hosten. GPU-Anforderungen, Quantisierung, API-Serving-Frameworks und Durchsatz-Benchmarks für Europa.

Claude Code, Codex und Grok CLI auf Ihrem eigenen Cloud-Server ausführen
cloudaivps

Claude Code, Codex und Grok CLI auf Ihrem eigenen Cloud-Server ausführen

Machen Sie einen Debian- oder Ubuntu-Cloud-Server zur Sandbox für KI-Coding-Agenten wie Claude Code, Codex und Grok CLI. Coden Sie von überall.