Serveur cloud pour Ollama en Europe: guide IA auto-hebergee EU
Ollama est le moyen le plus rapide de faire tourner un LLM local - une seule commande installe le runtime, telecharge un modèle et expose une API compatible OpenAI. Pour les equipes européennes, exécuter Ollama sur un serveur cloud EU signifie que toute l'inférence IA reste sous juridiction européenne, satisfaisant les exigences RGPD.
Pourquoi exécuter Ollama sur un serveur cloud EU
L'hébergement EU est important car Ollama sert de point de terminaison d'inférence pour vos applications. Chaque prompt envoyé par vos utilisateurs passe par ce serveur. Selon le RGPD, si ces prompts contiennent des données personnelles, l'inférence doit se produire sur une infrastructure sous juridiction européenne. Un serveur cloud DCXV EU avec Ollama vous donne un point de terminaison IA privé et conforme.
Choisir le bon modèle
- llama3.1:8b - meilleur modèle polyvalent pour chat, resume, Q&A. 4-5 Go VRAM en Q4.
- llama3.1:70b - qualite proche de GPT-4. Nécessite 40+ Go VRAM.
- mistral:7b - rapide, efficace, excellent pour la sortie structuree.
- nomic-embed-text - modèle d'embedding pour pipelines RAG. 274 Mo.
- codellama:13b - generation et revue de code.
- phi3:mini - très rapide sur CPU, utile pour la classification.
Specifications minimales pour Ollama
- CPU uniquement (petits modèles, 7B Q4) - 8 vCPU, 16 Go RAM, 100 Go NVMe SSD
- CPU production (requêtes parallèles) - 16 vCPU, 32 Go RAM, 200 Go NVMe SSD
- GPU entrée (7B-13B a FP16) - 4 vCPU, 16 Go RAM, 16-24 Go VRAM
- GPU production (modèles 34B+) - 8 vCPU, 64 Go RAM, 40-80 Go VRAM
Configuration DCXV recommandée
Les serveurs cloud DCXV fonctionnent sur infrastructure Tier III en UE:
- Serveur CPU, 16 vCPU / 32 Go RAM - sert des modèles 7B a 18-28 tokens/s
- Serveur GPU, 16-24 Go VRAM - sert des modèles 7B-13B a 80-120 tokens/s
- Serveur GPU, 80 Go VRAM - sert des modèles 70B a 25-40 tokens/s
Contactez sales@dcxv.com pour des instances GPU ou CPU.
Commandes de configuration rapide
# Installer Ollama sur Ubuntu 22.04
curl -fsSL https://ollama.com/install.sh | sh
# Télécharger des modèles
ollama pull llama3.1:8b
ollama pull mistral:7b
ollama pull nomic-embed-text
ollama list
# Configurer Ollama pour le réseau privé
# /etc/systemd/system/ollama.service:
# Environment="OLLAMA_HOST=0.0.0.0:11434"
# Environment="OLLAMA_NUM_PARALLEL=4"
sudo systemctl daemon-reload && sudo systemctl restart ollama
curl http://10.0.0.5:11434/api/tags
# Utiliser l'API compatible OpenAI
curl http://10.0.0.5:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "llama3.1:8b",
"messages": [{"rôle": "user", "content": "Quest-ce que le RGPD?"}]
}'
Quelle quantification télécharger
Chaque modèle ci-dessus existe en plusieurs builds, et le tag décide de ce qui subsiste des poids d'origine. ollama pull llama3.1:8b vous donne Q4_K_M - les 4,7 Go des commandes ci-dessus - et cette valeur par défaut a raison plus souvent qu'elle ne se trompe:
| Build | Un modèle 8B demande | Ce que vous perdez | Prenez-le quand |
|---|---|---|---|
| Q4_K_M | environ 4,7 Go | Peu de chose visible en chat ou en résumé | C'est la valeur par défaut, et la bonne pour l'essentiel |
| Q5_K_M | environ 5,7 Go | Presque rien que vous remarquiez | La mémoire est libre et vous voulez l'utiliser |
| Q8_0 | environ 8,5 Go | Rien qui mérite d'être nommé | Sortie structurée qui doit se parser à chaque fois |
| fp16 | environ 16 Go | Rien, ce sont les poids d'origine | Comparaison à une référence, ou fine-tuning |
Le chiffre à retenir n'est pas la taille du fichier mais la taille du fichier plus la fenêtre de contexte. Un modèle de 4,7 Go avec un contexte de 32k peut réclamer deux à trois gigaoctets de plus pour le cache KV, et voilà comment un modèle 7B sur une machine où "16 Go suffisent" finit par utiliser le swap.
Performances attendues
CPU (16 vCPU), llama3.1:8b Q4_K_M:
- Generation (requete unique) - 18-28 tokens/s
- Débit d'embeddings - 250-400 vecteurs/s
GPU (16 Go VRAM), llama3.1:8b FP16:
- Generation (requete unique) - 80-120 tokens/s
- Temps au premier token - 100-250 ms
Ce sont des attentes pour du matériel de cette classe, pas des mesures issues de notre propre laboratoire. Prenez-les comme point de départ pour le dimensionnement et mesurez votre charge : les chiffres réels dépendent de vos données, de vos requêtes et de votre tuning bien plus que du fournisseur.
Conclusion
Ollama sur un serveur cloud DCXV EU donne a votre équipe un point de terminaison IA privé et conforme au RGPD. L'installation prend moins de cinq minutes.
