Cloud-Server für LLM-Hosting in Europa: DSGVO-KI-Leitfaden

Cloud-Server für LLM-Hosting in Europa: DSGVO-KI-Leitfaden

Cloud-Server für LLM-Hosting in Europa: DSGVO-KI-Leitfaden

Das Self-Hosting eines grossen Sprachmodells gibt Ihnen vollständige Kontrolle darüber, welche Daten in das Modell eingehen, wo sie verarbeitet werden und wer Zugriff hat. Für europäische Unternehmen ist dies nicht nur ein Kostenargument - es ist eine Compliance-Anforderung. Jeder Prompt mit personenbezogenen Daten von EU-Einwohnern muss gemas DSGVO unter EU-Gerichtsbarkeit verarbeitet werden.

Warum EU-Gerichtsbarkeit für LLM-Hosting wichtig ist

Wenn Nutzer mit einem LLM interagieren - Fragen stellen, Dokumente zusammenfassen - enthalten diese Prompts oft Namen, E-Mail-Adressen und andere personenbezogene Daten. Das Senden an eine US-gehostete API bedeutet, dass personenbezogene Daten bei jeder Anfrage die EU-Gerichtsbarkeit verlassen.

Self-Hosting auf einem DCXV EU-Cloud-Server bedeutet, dass alle Inferenz innerhalb der EU bleibt. Für Gesundheits-, Rechts- und Finanzanwendungen in Europa ist selbst gehostete EU-LLM-Infrastruktur der praktische Weg zur DSGVO-Konformität.

Modellgrosse und Quantisierung wählen

  • 7B-Modelle (Q4, ~4 GB VRAM) - Zusammenfassung, Klassifizierung, Dokumenten-Q&A
  • 13B-Modelle (Q4, ~8 GB VRAM) - starkeres Reasoning, besseres Instruction-Following
  • 34B-Modelle (Q4, ~20 GB VRAM) - nähe GPT-3.5-Qualität
  • 70B-Modelle (Q4, ~40 GB VRAM) - GPT-4-Klasse für viele Aufgaben

Mindestanforderungen für LLM-Hosting

  • CPU-Serving (7B Q4) - 16 vCPU, 32 GB RAM, 200 GB NVMe SSD
  • GPU Einstieg (7B-13B, RTX 4090) - 8 vCPU, 32 GB RAM, 24 GB VRAM, 500 GB NVMe
  • GPU Mittel (34B Q4, A100 40 GB) - 16 vCPU, 64 GB RAM, 40 GB VRAM, 1 TB NVMe
  • GPU Hoch (70B Q4, A100 80 GB) - 16 vCPU, 128 GB RAM, 80 GB VRAM, 2 TB NVMe

Empfohlene DCXV-Konfiguration

DCXV Cloud-Server bieten GPU-ausgestattete EU-Server für LLM-Hosting:

  • GPU-Server, 24 GB VRAM - 7B-13B-Modelle für SaaS-Copilots und interne Assistenten
  • GPU-Server, 80 GB VRAM - 70B-Modelle für hochwertige Produktions-APIs
  • CPU-Server, 32-64 GB RAM - 7B-Modelle über llama.cpp für Hintergrundverarbeitung

Kontaktieren Sie sales@dcxv.com für GPU-Verfügbarkeit.

Schnell-Setup-Befehle

# Option 1: Ollama (einfachste Methode)
curl -fsSL https://ollama.com/install.sh | sh
sudo systemctl enable --now ollama
ollama pull llama3.1:8b

# Im privaten Netzwerk bereitstellen:
# Environment="OLLAMA_HOST=0.0.0.0:11434"
sudo systemctl daemon-reload && sudo systemctl restart ollama
# Option 2: vLLM für GPU-Hochdurchsatz (OpenAI-kompatible API)
pip install vllm

python -m vllm.entrypoints.openai.api_server \
  --model meta-llama/Llama-3.1-8B-Instruct \
  --host 10.0.0.5 --port 8000 \
  --gpu-memory-utilization 0.90

Welche Serving-Laufzeit Sie wählen sollten

Die Befehle oben zeigen zwei Wege, dieselben Gewichte auszuliefern, und die Wahl betrifft nicht die Qualität - alle führen dasselbe Modell aus. Es geht darum, was passiert, wenn die zweite Anfrage eintrifft, bevor die erste fertig ist:

Laufzeit Gleichzeitige Anfragen Wo sie am besten läuft Wählen Sie sie, wenn
Ollama In der Warteschlange, eine nach der anderen CPU oder eine einzelne GPU Interne Werkzeuge, ein Nutzer, schnellster Aufbau
llama.cpp In der Warteschlange, mit kleinem Batch CPU, GGUF-Gewichte Gar keine GPU, oder nächtliche Stapelarbeit
vLLM Fortlaufend gebatcht Nur GPU Viele Nutzer teilen eine GPU und Durchsatz zählt
TGI Fortlaufend gebatcht Nur GPU Sie arbeiten schon mit dem Hugging-Face-Stack

Der Unterschied ist größer, als er aussieht. Eine GPU, die eine Anfrage auf einmal bedient, wartet die meiste Zeit auf Speicher, also kann eine batchende Laufzeit ein Mehrfaches an Nutzern auf derselben Karte bedienen, ohne am Modell etwas zu ändern. Deshalb sind die CPU-Werte und die GPU-Werte unten nicht dieselbe Messung mit einem Faktor, sondern unterschiedlich geformte Arbeit.

Erwartete Leistungswerte

vLLM auf RTX 4090, Llama 3.1 8B FP16:

  • Einzelanfrage-Generierung - 80-120 Token/s
  • Batch-Durchsatz (8 gleichzeitig) - 400-700 Token/s
  • Zeit bis zum ersten Token - 150-300 ms

llama.cpp CPU (16 vCPU), 8B Q4_K_M:

  • Generierungsgeschwindigkeit - 18-30 Token/s

Das sind Erwartungen für Hardware dieser Klasse, keine Messungen aus unserem Labor. Nehmen Sie sie als Ausgangspunkt für die Dimensionierung und messen Sie Ihre eigene Last: die echten Zahlen hängen von Ihren Daten, Ihren Abfragen und Ihrem Tuning weit mehr ab als vom Anbieter.

Fazit

Self-Hosting von LLMs auf EU-Infrastruktur ist der zuverlassigste Weg zu DSGVO-konformer KI in der Produktion.

So verbinden Sie sich per SSH mit Ihrem neuen Cloud-Server
sshtutorialcloud

So verbinden Sie sich per SSH mit Ihrem neuen Cloud-Server

Der Server ist bereit, die Konsole zeigt IP, Login und Passwort. Hier sind die erste SSH-Verbindung, die vier häufigsten Fehler und die ersten zehn Minuten.

So verbinden Sie sich per Remotedesktop mit einem Windows-Server
rdpwindowstutorialcloud

So verbinden Sie sich per Remotedesktop mit einem Windows-Server

Sie haben Adresse, Benutzername und Passwort. So wird daraus ein Windows-Desktop auf Ihrem Bildschirm - vom PC, Mac oder Telefon aus, Schritt für Schritt.

Cloud-Server für Stable Diffusion in Europa: GPU-Setup-Leitfaden
cloudaigpu

Cloud-Server für Stable Diffusion in Europa: GPU-Setup-Leitfaden

Stable Diffusion auf einem DSGVO-konformen EU-Cloud-Server betreiben. GPU-Anforderungen, AUTOMATIC1111- und ComfyUI-Setup, Modellspeicher und Benchmarks.

Cloud-Server für LLM-Hosting in Europa: DSGVO-KI-Leitfaden
cloudaigpu

Cloud-Server für LLM-Hosting in Europa: DSGVO-KI-Leitfaden

Grosse Sprachmodelle auf einem DSGVO-konformen EU-Cloud-Server hosten. GPU-Anforderungen, Quantisierung, API-Serving-Frameworks und Durchsatz-Benchmarks für Europa.

Claude Code, Codex und Grok CLI auf Ihrem eigenen Cloud-Server ausführen
cloudaivps

Claude Code, Codex und Grok CLI auf Ihrem eigenen Cloud-Server ausführen

Machen Sie einen Debian- oder Ubuntu-Cloud-Server zur Sandbox für KI-Coding-Agenten wie Claude Code, Codex und Grok CLI. Coden Sie von überall.