Nous proposons
Nos prix abordables
Hardware de marque uniquement, contrôle total, pas de limites de trafic, aucune surprise!
Serveurs GPU NVIDIA pour l'AI, l'apprentissage automatique et le rendu dans des centres de données Tier III de l'UE
Hardware de marque uniquement, contrôle total, pas de limites de trafic, aucune surprise!
Infrastructure de niveau entreprise avec garantie de disponibilité 99.9% dans les emplacements UE
Obtenez vos serveurs et ressources en ligne en heures, pas en jours. Aucuns frais d'installation
Opérations conformes RGPD avec toutes les données stockées dans les centres de données européens
Un serveur GPU est une machine dédiée avec un ou plusieurs accélérateurs, dans nos propres baies européennes. Vous obtenez la carte entière - pas une fraction partagée dans le temps - avec le CPU, la RAM et le NVMe nécessaires pour l'alimenter, ce qui décide le plus souvent du débit réel.
Les cartes proposées changent au gré des approvisionnements : la page de configuration est donc la liste honnête, pas un tableau figé ici. Ce qui ne change pas, c'est la forme : assez de RAM système pour tenir un modèle pendant son chargement, du NVMe assez rapide pour que le chargement des données ne soit pas le goulot d'étranglement, et un port réseau capable de faire entrer un jeu de données.
La contrainte pratique, c'est la VRAM. Un modèle de 7 milliards de paramètres quantifié en 4 bits tient confortablement sur une carte de 16 Go et laisse la place à une fenêtre de contexte utile ; 13B demande 24 Go ; un modèle 70B quantifié de la même façon réclame environ 40 à 48 Go, ou deux cartes. Servir en pleine précision 16 bits double à peu près chacun de ces chiffres.
Si un modèle ne tient pas, la réponse est la quantification, un modèle plus petit ou une carte de plus - pas le débordement vers la RAM système, qui transforme un assistant interactif en traitement par lots.
vLLM pour du service à haut débit avec un point d'accès compatible OpenAI, Ollama quand la simplicité compte plus que le pic de jetons par seconde, llama.cpp pour l'empreinte la plus faible, et PyTorch directement pour tout ce qui est sur mesure. Tous s'installent exactement comme sur n'importe quelle machine Ubuntu, puisque c'est précisément ce que c'est.
L'inférence est sensible à la latence et surtout bornée par la VRAM et la bande passante mémoire : une carte, assez grande, et un chemin court vers le client. Elle tourne en continu, une machine au mois est donc l'arrangement le moins cher.
L'entraînement et le fine-tuning sont bornés par le débit et arrivent par à-coups. Ils veulent plus de cartes, beaucoup plus de RAM système et du NVMe assez grand pour le jeu de données. Si le travail est occasionnel, dimensionnez pour la pointe et rendez la machine ensuite plutôt que de payer du silicium inactif.
Ce qui amène la plupart de nos clients GPU ici, ce n'est pas le prix. C'est qu'un modèle qui tourne sur une machine louée à Prague ou à Covilhã n'envoie pas vos requêtes à un tiers, n'entraîne pas le modèle de quelqu'un d'autre avec vos documents, et se trouve dans une juridiction que vous pouvez nommer dans un contrat de sous-traitance.
Cela compte pour tout ce qui touche aux dossiers clients, aux contrats, aux données médicales ou financières - les charges pour lesquelles une API d'inférence publique est un problème de conformité avant d'être un problème technique.
Les machines GPU sont physiques et assemblées à la commande, le délai est donc plus long que pour un serveur cloud : indiquez au support le modèle que vous comptez servir et la concurrence attendue, il vous indiquera la plus petite carte qui y parvient, et non la plus grosse en stock.
Les deux sites Tier III peuvent les héberger, et le choix suit vos utilisateurs comme pour n'importe quel autre serveur.
Questions fréquentes
La carte entière. Un serveur GPU est une machine dédiée à laquelle l'accélérateur est rattaché, avec le CPU, la RAM et le NVMe nécessaires pour l'alimenter - et c'est généralement cela qui décide du débit réel, pas la carte seule
La contrainte est la VRAM. Un modèle de 7 milliards de paramètres quantifié en 4 bits tient confortablement dans 16 Go et laisse la place à une fenêtre de contexte utile, 13B demande 24 Go, et un modèle 70B quantifié de la même façon réclame environ 40 à 48 Go ou deux cartes. Servir en pleine précision 16 bits double à peu près chaque chiffre
Tout ce qui tourne sous Ubuntu avec les pilotes NVIDIA : vLLM pour du service à haut débit avec un point d'accès compatible OpenAI, Ollama quand la simplicité prime sur le débit maximal, llama.cpp pour l'empreinte la plus faible, ou PyTorch directement pour du sur-mesure
Ils demandent des machines différentes. L'inférence est bornée par la latence et surtout limitée par la VRAM : une carte suffisamment grande fonctionnant en continu est l'arrangement le moins cher. L'entraînement et le fine-tuning sont bornés par le débit et arrivent par à-coups - plus de cartes, beaucoup plus de RAM système et du NVMe assez grand pour le jeu de données
Nulle part. Le modèle tourne sur une machine que vous louez à Prague ou à Covilhã : les requêtes ne sont pas envoyées à un tiers, rien ne sert à entraîner le modèle de quelqu'un d'autre, et la juridiction est une que vous pouvez nommer dans un contrat de sous-traitance
Plus longtemps que pour un serveur cloud, car la machine est physique et assemblée à la commande. Indiquez au support le modèle que vous comptez servir et la concurrence attendue, et il dimensionnera la plus petite carte capable de le faire, plutôt que la plus grosse en stock
Si vous avez besoin d'aide ou avez des questions supplémentaires, veuillez contacter les managers ou écrire à l'équipe de support à support@dcxv.com