GPU-Server für Deutschland

NVIDIA-GPU-Server für AI, maschinelles Lernen und Rendering in Tier-III-EU-Rechenzentren

Tier III zertifiziert ISO 9001 ISO/IEC 27001 ISO 14001 DSGVO-konform

Wir bieten

Unsere erschwinglichen Preise

Nur Marken-Hardware, vollständige Kontrolle, keine Traffic-Limits, keine Überraschungen!

1
1
1
1
IP 1 IP
1 IP min max 7 IP
Im Voraus bezahlte Monate 6 month
6 month min max 12 month

Warum uns wählen

TIER III Rechenzentren

Unternehmensfähige Infrastruktur mit 99.9% Verfügbarkeitsgarantie in EU-Standorten

Sofortige Bereitstellung

Bringen Sie Ihre Server und Ressourcen innerhalb von Stunden online, nicht Tagen. Keine Installationsgebühr

EU-Compliance

GDPR-konforme Operationen mit allen Daten gespeichert in europäischen Rechenzentren

GPU-Server für Inferenz, Training und Rendering

Ein GPU-Server ist eine dedizierte Maschine mit einem oder mehreren Beschleunigern, in unseren eigenen europäischen Racks. Sie bekommen die ganze Karte - nicht einen zeitlich geteilten Bruchteil davon - zusammen mit CPU, RAM und NVMe, um sie auszulasten, und genau das entscheidet meist über den tatsächlichen Durchsatz.

Welche Karten verfügbar sind, ändert sich mit der Liefersituation, deshalb ist die Konfigurationsseite die ehrliche Liste und nicht eine feste Tabelle an dieser Stelle. Was sich nicht ändert, ist die Form: genug Arbeitsspeicher, um ein Modell beim Laden zu halten, NVMe schnell genug, dass das Laden der Daten nicht zum Engpass wird, und ein Netzwerkport, über den ein Datensatz hereinkommt.

Welche Modellgrößen auf welche Karte passen

Die praktische Grenze ist VRAM. Ein Modell mit 7 Milliarden Parametern, auf 4 Bit quantisiert, passt bequem auf eine 16-GB-Karte und lässt Platz für ein brauchbares Kontextfenster; 13B will 24 GB; ein 70B-Modell gleicher Quantisierung braucht rund 40-48 GB oder zwei Karten. In voller 16-Bit-Präzision verdoppeln sich diese Zahlen ungefähr.

Passt ein Modell nicht, lautet die Antwort Quantisierung, ein kleineres Modell oder eine weitere Karte - nicht das Auslagern in den Arbeitsspeicher, das aus einem interaktiven Assistenten einen Batch-Job macht.

Die Software, die tatsächlich eingesetzt wird

vLLM für Serving mit hohem Durchsatz und OpenAI-kompatiblem Endpunkt, Ollama, wenn Bequemlichkeit mehr zählt als maximale Token pro Sekunde, llama.cpp für den kleinsten Fußabdruck und PyTorch direkt für alles Eigene. Alle installieren sich genauso wie auf jeder anderen Ubuntu-Maschine, denn genau das ist es.

Inferenz oder Training - sie brauchen verschiedene Maschinen

Inferenz ist latenzempfindlich und wird meist von VRAM und Speicherbandbreite begrenzt: eine Karte, groß genug, und ein kurzer Weg zum Client. Sie läuft durchgehend, also ist eine monatliche Maschine die günstigere Lösung.

Training und Fine-Tuning sind durchsatzgebunden und stoßweise. Sie wollen mehr Karten, deutlich mehr Arbeitsspeicher und NVMe groß genug für den Datensatz. Fällt die Arbeit nur gelegentlich an, dimensionieren Sie für die Spitze und geben die Maschine danach zurück, statt für ungenutztes Silizium zu zahlen.

Private KI, und wo die Daten liegen

Der Grund, aus dem die meisten unserer GPU-Kunden hier sind, ist nicht der Preis. Es ist, dass ein Modell auf einer Maschine, die Sie in Prag oder Covilha mieten, keine Prompts an Dritte schickt, mit Ihren Dokumenten nicht das Modell eines anderen trainiert und in einer Rechtsordnung liegt, die Sie in einem Auftragsverarbeitungsvertrag benennen können.

Das zählt bei allem, was Kundendaten, Verträge, medizinische oder finanzielle Daten berührt - den Workloads, bei denen eine öffentliche Inferenz-API ein Compliance-Problem ist, bevor sie ein technisches ist.

Standorte und wie Sie einen bekommen

GPU-Maschinen sind physisch und werden auf Bestellung gebaut, die Vorlaufzeit ist also länger als bei einem Cloud-Server. Sagen Sie dem Support, welches Modell Sie ausliefern wollen und mit welcher Parallelität, dann nennt er Ihnen die kleinste Karte, die das schafft - und nicht die größte auf Lager.

Beide Tier-III-Standorte können sie beherbergen, und die Wahl folgt Ihren Nutzern genauso wie bei jedem anderen Server.

FAQ

Häufig gestellte Fragen

Bekomme ich die ganze GPU oder einen Anteil davon?

Die ganze Karte. Ein GPU-Server ist eine dedizierte Maschine, an der der Beschleuniger hängt, zusammen mit der CPU, dem RAM und dem NVMe, um die Karte auszulasten - und das entscheidet meist über den tatsächlichen Durchsatz, nicht die Karte allein

Welche Modellgrößen passen auf welche Karte?

Die Grenze ist der VRAM. Ein Modell mit 7 Milliarden Parametern, auf 4 Bit quantisiert, passt bequem in 16 GB und lässt Platz für ein brauchbares Kontextfenster, 13B will 24 GB, und ein 70B-Modell gleicher Quantisierung braucht rund 40-48 GB oder zwei Karten. In voller 16-Bit-Präzision verdoppelt sich jede dieser Zahlen ungefähr

Welche Serving-Stacks werden unterstützt?

Alles, was unter Ubuntu mit NVIDIA-Treibern läuft: vLLM für Serving mit hohem Durchsatz und OpenAI-kompatiblem Endpunkt, Ollama, wenn Bequemlichkeit mehr zählt als Spitzendurchsatz, llama.cpp für den kleinsten Fußabdruck oder PyTorch direkt für eigene Arbeiten

Eignet sich ein GPU-Server besser für Inferenz oder für Training?

Sie brauchen verschiedene Maschinen. Inferenz ist latenzgebunden und meist durch VRAM begrenzt, also ist eine ausreichend große Karte im Dauerbetrieb die günstigere Lösung. Training und Fine-Tuning sind durchsatzgebunden und stoßweise - mehr Karten, deutlich mehr Arbeitsspeicher und NVMe groß genug für den Datensatz

Wohin gehen meine Daten, wenn ich hier ein Modell betreibe?

Nirgendwohin. Das Modell läuft auf einer Maschine, die Sie in Prag oder Covilha mieten: Prompts gehen nicht an Dritte, nichts wird verwendet, um das Modell eines anderen zu trainieren, und die Rechtsordnung ist eine, die Sie in einem Auftragsverarbeitungsvertrag benennen können

Wie lange dauert es, eine zu bekommen?

Länger als bei einem Cloud-Server, denn die Maschine ist physisch und wird auf Bestellung gebaut. Sagen Sie dem Support, welches Modell Sie ausliefern wollen und mit welcher Parallelität, dann dimensioniert er die kleinste Karte, die das schafft - statt der größten auf Lager

Wenn Sie Hilfe benötigen oder zusätzliche Fragen haben, wenden Sie sich bitte an die Manager oder schreiben Sie an das Support-Team unter support@dcxv.com