Serveur cloud pour hébergement LLM en Europe: guide IA RGPD
L'auto-hébergement d'un grand modèle de langage vous donne un contrôle total sur les données qui entrent dans le modèle, leur lieu de traitement et les personnes qui y ont accès. Pour les entreprises européennes, ce n'est pas seulement un argument de coût - c'est une obligation de conformité. Tout prompt contenant des données personnelles de residents de l'UE doit être traite sous juridiction européenne selon le RGPD.
Pourquoi la juridiction UE est importante pour l'hébergement LLM
Lorsque les utilisateurs interagissent avec un LLM - posant des questions, resumant des documents - ces prompts contiennent souvent des noms, adresses email et autres données personnelles. Les envoyer a une API hebergee aux États-Unis signifie que les données personnelles quittent la juridiction européenne a chaque requete.
L'auto-hébergement sur un serveur cloud DCXV EU signifie que toute l'inférence reste dans les frontieres de l'UE. Pour les applications de sante, juridiques et financieres en Europe, l'infrastructure LLM auto-hebergee en UE est le chemin pratique vers la conformité RGPD.
Choisir la taille du modèle et la quantification
- Modèles 7B (Q4, ~4 Go VRAM) - resume, classification, Q&A sur documents
- Modèles 13B (Q4, ~8 Go VRAM) - meilleur raisonnement, meilleur suivi d'instructions
- Modèles 34B (Q4, ~20 Go VRAM) - qualite proche de GPT-3.5
- Modèles 70B (Q4, ~40 Go VRAM) - classe GPT-4 pour de nombreuses tâches
Specifications minimales pour l'hébergement LLM
- Serving CPU (7B Q4) - 16 vCPU, 32 Go RAM, 200 Go NVMe SSD
- GPU entrée (7B-13B, RTX 4090) - 8 vCPU, 32 Go RAM, 24 Go VRAM, 500 Go NVMe
- GPU moyen (34B Q4, A100 40 Go) - 16 vCPU, 64 Go RAM, 40 Go VRAM, 1 To NVMe
- GPU haut (70B Q4, A100 80 Go) - 16 vCPU, 128 Go RAM, 80 Go VRAM, 2 To NVMe
Configuration DCXV recommandée
Les serveurs cloud DCXV fournissent des serveurs EU equipes de GPU pour l'hébergement LLM:
- Serveur GPU, 24 Go VRAM - modèles 7B-13B pour copilotes SaaS
- Serveur GPU, 80 Go VRAM - modèles 70B pour APIs de production
- Serveur CPU, 32-64 Go RAM - modèles 7B via llama.cpp pour traitement en arrière-plan
Contactez sales@dcxv.com pour la disponibilité GPU.
Commandes de configuration rapide
# Option 1: Ollama (plus simple)
curl -fsSL https://ollama.com/install.sh | sh
sudo systemctl enable --now ollama
ollama pull llama3.1:8b
# Exposer sur réseau privé:
# Environment="OLLAMA_HOST=0.0.0.0:11434"
sudo systemctl daemon-reload && sudo systemctl restart ollama
# Option 2: vLLM pour GPU haut débit
pip install vllm
python -m vllm.entrypoints.openai.api_server \
--model meta-llama/Llama-3.1-8B-Instruct \
--host 10.0.0.5 --port 8000 \
--gpu-memory-utilization 0.90
Quel runtime de service choisir
Les commandes ci-dessus montrent deux façons de servir les mêmes poids, et le choix ne porte pas sur la qualité - tous exécutent le même modèle. Il porte sur ce qui se passe quand la deuxième requête arrive avant la fin de la première:
| Runtime | Requêtes simultanées | Où il fonctionne le mieux | Choisissez-le quand |
|---|---|---|---|
| Ollama | En file, une à la fois | CPU ou un seul GPU | Outils internes, un utilisateur, mise en place la plus rapide |
| llama.cpp | En file, avec un petit lot | CPU, poids GGUF | Aucun GPU, ou du travail par lots la nuit |
| vLLM | Traitement par lots continu | GPU uniquement | Plusieurs utilisateurs partagent un GPU et le débit compte |
| TGI | Traitement par lots continu | GPU uniquement | Vous êtes déjà sur la pile Hugging Face |
L'écart est plus grand qu'il n'y paraît. Un GPU qui sert une requête à la fois passe l'essentiel de son temps à attendre la mémoire, donc un runtime qui regroupe les requêtes peut servir plusieurs fois plus d'utilisateurs sur la même carte sans rien changer au modèle. C'est pourquoi les chiffres CPU et les chiffres GPU ci-dessous ne sont pas la même mesure à l'échelle, mais des formes de travail différentes.
Performances attendues
vLLM sur RTX 4090, Llama 3.1 8B FP16:
- Generation (requete unique) - 80-120 tokens/s
- Débit par lots (8 concurrents) - 400-700 tokens/s
- Temps au premier token - 150-300 ms
Ce sont des attentes pour du matériel de cette classe, pas des mesures issues de notre propre laboratoire. Prenez-les comme point de départ pour le dimensionnement et mesurez votre charge : les chiffres réels dépendent de vos données, de vos requêtes et de votre tuning bien plus que du fournisseur.
Conclusion
L'auto-hébergement de LLM sur infrastructure EU est le chemin le plus fiable vers une IA conforme au RGPD en production.
