Serveur cloud pour Ollama en Europe: guide IA auto-hebergee EU

Serveur cloud pour Ollama en Europe: guide IA auto-hebergee EU

Serveur cloud pour Ollama en Europe: guide IA auto-hebergee EU

Ollama est le moyen le plus rapide de faire tourner un LLM local - une seule commande installe le runtime, telecharge un modèle et expose une API compatible OpenAI. Pour les equipes européennes, exécuter Ollama sur un serveur cloud EU signifie que toute l'inférence IA reste sous juridiction européenne, satisfaisant les exigences RGPD.

Pourquoi exécuter Ollama sur un serveur cloud EU

L'hébergement EU est important car Ollama sert de point de terminaison d'inférence pour vos applications. Chaque prompt envoyé par vos utilisateurs passe par ce serveur. Selon le RGPD, si ces prompts contiennent des données personnelles, l'inférence doit se produire sur une infrastructure sous juridiction européenne. Un serveur cloud DCXV EU avec Ollama vous donne un point de terminaison IA privé et conforme.

Choisir le bon modèle

  • llama3.1:8b - meilleur modèle polyvalent pour chat, resume, Q&A. 4-5 Go VRAM en Q4.
  • llama3.1:70b - qualite proche de GPT-4. Nécessite 40+ Go VRAM.
  • mistral:7b - rapide, efficace, excellent pour la sortie structuree.
  • nomic-embed-text - modèle d'embedding pour pipelines RAG. 274 Mo.
  • codellama:13b - generation et revue de code.
  • phi3:mini - très rapide sur CPU, utile pour la classification.

Specifications minimales pour Ollama

  • CPU uniquement (petits modèles, 7B Q4) - 8 vCPU, 16 Go RAM, 100 Go NVMe SSD
  • CPU production (requêtes parallèles) - 16 vCPU, 32 Go RAM, 200 Go NVMe SSD
  • GPU entrée (7B-13B a FP16) - 4 vCPU, 16 Go RAM, 16-24 Go VRAM
  • GPU production (modèles 34B+) - 8 vCPU, 64 Go RAM, 40-80 Go VRAM

Configuration DCXV recommandée

Les serveurs cloud DCXV fonctionnent sur infrastructure Tier III en UE:

  • Serveur CPU, 16 vCPU / 32 Go RAM - sert des modèles 7B a 18-28 tokens/s
  • Serveur GPU, 16-24 Go VRAM - sert des modèles 7B-13B a 80-120 tokens/s
  • Serveur GPU, 80 Go VRAM - sert des modèles 70B a 25-40 tokens/s

Contactez sales@dcxv.com pour des instances GPU ou CPU.

Commandes de configuration rapide

# Installer Ollama sur Ubuntu 22.04
curl -fsSL https://ollama.com/install.sh | sh

# Télécharger des modèles
ollama pull llama3.1:8b
ollama pull mistral:7b
ollama pull nomic-embed-text
ollama list
# Configurer Ollama pour le réseau privé
# /etc/systemd/system/ollama.service:
# Environment="OLLAMA_HOST=0.0.0.0:11434"
# Environment="OLLAMA_NUM_PARALLEL=4"

sudo systemctl daemon-reload && sudo systemctl restart ollama
curl http://10.0.0.5:11434/api/tags
# Utiliser l'API compatible OpenAI
curl http://10.0.0.5:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "llama3.1:8b",
    "messages": [{"rôle": "user", "content": "Quest-ce que le RGPD?"}]
  }'

Quelle quantification télécharger

Chaque modèle ci-dessus existe en plusieurs builds, et le tag décide de ce qui subsiste des poids d'origine. ollama pull llama3.1:8b vous donne Q4_K_M - les 4,7 Go des commandes ci-dessus - et cette valeur par défaut a raison plus souvent qu'elle ne se trompe:

Build Un modèle 8B demande Ce que vous perdez Prenez-le quand
Q4_K_M environ 4,7 Go Peu de chose visible en chat ou en résumé C'est la valeur par défaut, et la bonne pour l'essentiel
Q5_K_M environ 5,7 Go Presque rien que vous remarquiez La mémoire est libre et vous voulez l'utiliser
Q8_0 environ 8,5 Go Rien qui mérite d'être nommé Sortie structurée qui doit se parser à chaque fois
fp16 environ 16 Go Rien, ce sont les poids d'origine Comparaison à une référence, ou fine-tuning

Le chiffre à retenir n'est pas la taille du fichier mais la taille du fichier plus la fenêtre de contexte. Un modèle de 4,7 Go avec un contexte de 32k peut réclamer deux à trois gigaoctets de plus pour le cache KV, et voilà comment un modèle 7B sur une machine où "16 Go suffisent" finit par utiliser le swap.

Performances attendues

CPU (16 vCPU), llama3.1:8b Q4_K_M:

  • Generation (requete unique) - 18-28 tokens/s
  • Débit d'embeddings - 250-400 vecteurs/s

GPU (16 Go VRAM), llama3.1:8b FP16:

  • Generation (requete unique) - 80-120 tokens/s
  • Temps au premier token - 100-250 ms

Ce sont des attentes pour du matériel de cette classe, pas des mesures issues de notre propre laboratoire. Prenez-les comme point de départ pour le dimensionnement et mesurez votre charge : les chiffres réels dépendent de vos données, de vos requêtes et de votre tuning bien plus que du fournisseur.

Conclusion

Ollama sur un serveur cloud DCXV EU donne a votre équipe un point de terminaison IA privé et conforme au RGPD. L'installation prend moins de cinq minutes.

Comment se connecter à votre nouveau serveur cloud en SSH
sshtutorialcloud

Comment se connecter à votre nouveau serveur cloud en SSH

Le serveur est prêt et la console affiche IP, identifiant et mot de passe. Voici la première connexion SSH, les quatre erreurs les plus courantes et les dix premières minutes.

Comment se connecter à un serveur Windows avec le Bureau à distance
rdpwindowstutorialcloud

Comment se connecter à un serveur Windows avec le Bureau à distance

Vous avez une adresse, un identifiant et un mot de passe. Voici comment en faire un bureau Windows sur votre écran, depuis un PC, un Mac ou un téléphone, étape par étape.

Serveur cloud pour Stable Diffusion en Europe: configuration GPU
cloudaigpu

Serveur cloud pour Stable Diffusion en Europe: configuration GPU

Hébergez Stable Diffusion sur un serveur cloud EU conforme au RGPD. GPU, configuration AUTOMATIC1111 et ComfyUI, stockage de modèles et benchmarks de generation.

Serveur cloud pour hébergement LLM en Europe: guide IA RGPD
cloudaigpu

Serveur cloud pour hébergement LLM en Europe: guide IA RGPD

Hébergez de grands modèles de langage sur un serveur cloud EU conforme au RGPD. GPU, quantification, frameworks d'API et benchmarks de débit pour l'Europe.

Exécutez Claude Code, Codex et Grok CLI sur votre propre serveur cloud
cloudaivps

Exécutez Claude Code, Codex et Grok CLI sur votre propre serveur cloud

Transformez un serveur cloud Debian ou Ubuntu en bac à sable pour les agents IA comme Claude Code, Codex et Grok CLI. Codez depuis n'importe où.