Serveurs GPU en France

Serveurs GPU NVIDIA pour l'AI, l'apprentissage automatique et le rendu dans des centres de données Tier III de l'UE

Certifié Tier III ISO 9001 ISO/IEC 27001 ISO 14001 Conforme au RGPD

Nous proposons

Nos prix abordables

Hardware de marque uniquement, contrôle total, pas de limites de trafic, aucune surprise!

1
1
1
1
IP 1 IP
1 IP min max 7 IP
Mois payés à l'avance 6 month
6 month min max 12 month

Pourquoi nous choisir

Centres de données TIER III

Infrastructure de niveau entreprise avec garantie de disponibilité 99.9% dans les emplacements UE

Déploiement instantané

Obtenez vos serveurs et ressources en ligne en heures, pas en jours. Aucuns frais d'installation

Conformité UE

Opérations conformes RGPD avec toutes les données stockées dans les centres de données européens

Serveurs GPU pour l'inférence, l'entraînement et le rendu

Un serveur GPU est une machine dédiée avec un ou plusieurs accélérateurs, dans nos propres baies européennes. Vous obtenez la carte entière - pas une fraction partagée dans le temps - avec le CPU, la RAM et le NVMe nécessaires pour l'alimenter, ce qui décide le plus souvent du débit réel.

Les cartes proposées changent au gré des approvisionnements : la page de configuration est donc la liste honnête, pas un tableau figé ici. Ce qui ne change pas, c'est la forme : assez de RAM système pour tenir un modèle pendant son chargement, du NVMe assez rapide pour que le chargement des données ne soit pas le goulot d'étranglement, et un port réseau capable de faire entrer un jeu de données.

Quelles tailles de modèle tiennent sur quelle carte

La contrainte pratique, c'est la VRAM. Un modèle de 7 milliards de paramètres quantifié en 4 bits tient confortablement sur une carte de 16 Go et laisse la place à une fenêtre de contexte utile ; 13B demande 24 Go ; un modèle 70B quantifié de la même façon réclame environ 40 à 48 Go, ou deux cartes. Servir en pleine précision 16 bits double à peu près chacun de ces chiffres.

Si un modèle ne tient pas, la réponse est la quantification, un modèle plus petit ou une carte de plus - pas le débordement vers la RAM système, qui transforme un assistant interactif en traitement par lots.

Les logiciels réellement utilisés

vLLM pour du service à haut débit avec un point d'accès compatible OpenAI, Ollama quand la simplicité compte plus que le pic de jetons par seconde, llama.cpp pour l'empreinte la plus faible, et PyTorch directement pour tout ce qui est sur mesure. Tous s'installent exactement comme sur n'importe quelle machine Ubuntu, puisque c'est précisément ce que c'est.

Inférence ou entraînement : deux machines différentes

L'inférence est sensible à la latence et surtout bornée par la VRAM et la bande passante mémoire : une carte, assez grande, et un chemin court vers le client. Elle tourne en continu, une machine au mois est donc l'arrangement le moins cher.

L'entraînement et le fine-tuning sont bornés par le débit et arrivent par à-coups. Ils veulent plus de cartes, beaucoup plus de RAM système et du NVMe assez grand pour le jeu de données. Si le travail est occasionnel, dimensionnez pour la pointe et rendez la machine ensuite plutôt que de payer du silicium inactif.

IA privée, et où résident les données

Ce qui amène la plupart de nos clients GPU ici, ce n'est pas le prix. C'est qu'un modèle qui tourne sur une machine louée à Prague ou à Covilhã n'envoie pas vos requêtes à un tiers, n'entraîne pas le modèle de quelqu'un d'autre avec vos documents, et se trouve dans une juridiction que vous pouvez nommer dans un contrat de sous-traitance.

Cela compte pour tout ce qui touche aux dossiers clients, aux contrats, aux données médicales ou financières - les charges pour lesquelles une API d'inférence publique est un problème de conformité avant d'être un problème technique.

Localisations et comment en obtenir un

Les machines GPU sont physiques et assemblées à la commande, le délai est donc plus long que pour un serveur cloud : indiquez au support le modèle que vous comptez servir et la concurrence attendue, il vous indiquera la plus petite carte qui y parvient, et non la plus grosse en stock.

Les deux sites Tier III peuvent les héberger, et le choix suit vos utilisateurs comme pour n'importe quel autre serveur.

FAQ

Questions fréquentes

Est-ce que j'obtiens le GPU entier ou une part de GPU ?

La carte entière. Un serveur GPU est une machine dédiée à laquelle l'accélérateur est rattaché, avec le CPU, la RAM et le NVMe nécessaires pour l'alimenter - et c'est généralement cela qui décide du débit réel, pas la carte seule

Quelles tailles de modèle tiennent sur quelle carte ?

La contrainte est la VRAM. Un modèle de 7 milliards de paramètres quantifié en 4 bits tient confortablement dans 16 Go et laisse la place à une fenêtre de contexte utile, 13B demande 24 Go, et un modèle 70B quantifié de la même façon réclame environ 40 à 48 Go ou deux cartes. Servir en pleine précision 16 bits double à peu près chaque chiffre

Quelles piles de service sont prises en charge ?

Tout ce qui tourne sous Ubuntu avec les pilotes NVIDIA : vLLM pour du service à haut débit avec un point d'accès compatible OpenAI, Ollama quand la simplicité prime sur le débit maximal, llama.cpp pour l'empreinte la plus faible, ou PyTorch directement pour du sur-mesure

Un serveur GPU convient-il mieux à l'inférence ou à l'entraînement ?

Ils demandent des machines différentes. L'inférence est bornée par la latence et surtout limitée par la VRAM : une carte suffisamment grande fonctionnant en continu est l'arrangement le moins cher. L'entraînement et le fine-tuning sont bornés par le débit et arrivent par à-coups - plus de cartes, beaucoup plus de RAM système et du NVMe assez grand pour le jeu de données

Où vont mes données quand j'exécute un modèle ici ?

Nulle part. Le modèle tourne sur une machine que vous louez à Prague ou à Covilhã : les requêtes ne sont pas envoyées à un tiers, rien ne sert à entraîner le modèle de quelqu'un d'autre, et la juridiction est une que vous pouvez nommer dans un contrat de sous-traitance

Combien de temps faut-il pour en obtenir un ?

Plus longtemps que pour un serveur cloud, car la machine est physique et assemblée à la commande. Indiquez au support le modèle que vous comptez servir et la concurrence attendue, et il dimensionnera la plus petite carte capable de le faire, plutôt que la plus grosse en stock

Si vous avez besoin d'aide ou avez des questions supplémentaires, veuillez contacter les managers ou écrire à l'équipe de support à support@dcxv.com