Proponiamo
I nostri prezzi convenienti
Solo Hardware di Marca, Controllo Completo, Nessun Limite di Traffico, Nessuna Sorpresa!
Server GPU NVIDIA per AI, machine learning e rendering in data center Tier III dell'UE
Solo Hardware di Marca, Controllo Completo, Nessun Limite di Traffico, Nessuna Sorpresa!
Infrastruttura enterprise-grade con garanzia uptime 99.9% in tutte le location UE
Ottieni i tuoi server e risorse online in ore, non giorni. Nessuna commissione di installazione
Operazioni conformi GDPR con tutti i dati archiviati in data center europei
Un server GPU è una macchina dedicata con uno o più acceleratori, nei nostri rack europei. Ottieni l'intera scheda - non una frazione ripartita nel tempo - insieme a CPU, RAM e NVMe necessari ad alimentarla, che di solito è ciò che decide il throughput reale.
Le schede disponibili cambiano con le forniture, quindi la pagina di configurazione è l'elenco onesto e non una tabella fissa qui. Ciò che non cambia è la forma: RAM di sistema sufficiente a tenere un modello mentre carica, NVMe abbastanza veloce perché il caricamento dei dati non diventi il collo di bottiglia, e una porta di rete capace di far entrare un dataset.
Il vincolo pratico è la VRAM. Un modello da 7 miliardi di parametri quantizzato a 4 bit sta comodamente su una scheda da 16 GB e lascia spazio a una finestra di contesto utile; 13B vuole 24 GB; un modello da 70B con la stessa quantizzazione richiede circa 40-48 GB, oppure due schede. Servire a piena precisione a 16 bit raddoppia più o meno ciascuna di queste cifre.
Se un modello non ci sta, la risposta è la quantizzazione, un modello più piccolo o un'altra scheda - non lo swap sulla RAM di sistema, che trasforma un assistente interattivo in un lavoro batch.
vLLM per servire ad alto throughput con un endpoint compatibile OpenAI, Ollama quando la comodità conta più dei token al secondo di picco, llama.cpp per l'impronta più leggera e PyTorch direttamente per tutto ciò che è su misura. Si installano tutti come su qualsiasi macchina Ubuntu, perché è esattamente ciò che è.
L'inferenza è sensibile alla latenza ed è limitata soprattutto da VRAM e banda di memoria: una scheda, abbastanza capiente, e un percorso breve verso il client. Gira di continuo, quindi una macchina a canone mensile è la soluzione più economica.
Training e fine-tuning sono limitati dal throughput e arrivano a raffiche. Vogliono più schede, molta più RAM di sistema e NVMe capiente quanto il dataset. Se il lavoro è occasionale, dimensiona per il picco e restituisci la macchina invece di pagare silicio fermo.
Il motivo per cui la maggior parte dei nostri clienti GPU è qui non è il prezzo. È che un modello in esecuzione su una macchina che affitti a Praga o a Covilhã non manda i prompt a terzi, non addestra il modello di qualcun altro con i tuoi documenti e si trova in una giurisdizione che puoi indicare in un accordo sul trattamento dei dati.
Conta per tutto ciò che tocca anagrafiche clienti, contratti, dati sanitari o finanziari: i carichi per cui un'API di inferenza pubblica è un problema di conformità prima ancora che tecnico.
Le macchine GPU sono fisiche e vengono costruite su ordine, quindi i tempi sono più lunghi di un server cloud: di' al supporto quale modello intendi servire e con quale concorrenza, e ti indicherà la scheda più piccola che ce la fa, non la più grande a magazzino.
Entrambe le sedi Tier III possono ospitarle, e la scelta segue i tuoi utenti come per qualsiasi altro server.
Domande frequenti
L'intera scheda. Un server GPU è una macchina dedicata con l'acceleratore collegato, insieme a CPU, RAM e NVMe necessari ad alimentarlo, che di solito è ciò che decide il throughput reale, più della scheda da sola
Il vincolo è la VRAM. Un modello da 7 miliardi di parametri quantizzato a 4 bit sta comodamente in 16 GB e lascia spazio a una finestra di contesto utile, 13B chiede 24 GB, e un modello da 70B con la stessa quantizzazione richiede circa 40-48 GB o due schede. Servire a piena precisione a 16 bit raddoppia all'incirca ogni cifra
Qualunque cosa giri su Ubuntu con i driver NVIDIA: vLLM per servire ad alto throughput con un endpoint compatibile OpenAI, Ollama quando la comodità conta più del throughput di picco, llama.cpp per l'impronta più leggera, o PyTorch direttamente per lavori su misura
Vogliono macchine diverse. L'inferenza è limitata dalla latenza e soprattutto dalla VRAM, quindi una scheda abbastanza capiente in funzione continua è la soluzione più economica. Training e fine-tuning sono limitati dal throughput e arrivano a raffiche: più schede, molta più RAM di sistema e NVMe capiente quanto il dataset
Da nessuna parte. Il modello gira su una macchina che affitti a Praga o a Covilhã: i prompt non vengono inviati a terzi, nulla viene usato per addestrare il modello di altri e la giurisdizione è una che puoi indicare in un accordo sul trattamento dei dati
Più che per un server cloud, perché la macchina è fisica e viene costruita su ordine. Di' al supporto quale modello intendi servire e quale concorrenza prevedi, e dimensioneranno la scheda più piccola in grado di farlo, non la più grande a magazzino
Se hai bisogno di assistenza o hai domande aggiuntive, contatta i manager o scrivi al team di supporto a support@dcxv.com