Server GPU in Italia

Server GPU NVIDIA per AI, machine learning e rendering in data center Tier III dell'UE

Certificato Tier III ISO 9001 ISO/IEC 27001 ISO 14001 Conforme al GDPR

Proponiamo

I nostri prezzi convenienti

Solo Hardware di Marca, Controllo Completo, Nessun Limite di Traffico, Nessuna Sorpresa!

1
1
1
1
IP 1 IP
1 IP min max 7 IP
Mesi Pagati in Anticipo 6 month
6 month min max 12 month

Perché sceglierci

Data Center TIER III

Infrastruttura enterprise-grade con garanzia uptime 99.9% in tutte le location UE

Deployment Istantaneo

Ottieni i tuoi server e risorse online in ore, non giorni. Nessuna commissione di installazione

Conformità UE

Operazioni conformi GDPR con tutti i dati archiviati in data center europei

Server GPU per inferenza, training e rendering

Un server GPU è una macchina dedicata con uno o più acceleratori, nei nostri rack europei. Ottieni l'intera scheda - non una frazione ripartita nel tempo - insieme a CPU, RAM e NVMe necessari ad alimentarla, che di solito è ciò che decide il throughput reale.

Le schede disponibili cambiano con le forniture, quindi la pagina di configurazione è l'elenco onesto e non una tabella fissa qui. Ciò che non cambia è la forma: RAM di sistema sufficiente a tenere un modello mentre carica, NVMe abbastanza veloce perché il caricamento dei dati non diventi il collo di bottiglia, e una porta di rete capace di far entrare un dataset.

Quali dimensioni di modello stanno su quale scheda

Il vincolo pratico è la VRAM. Un modello da 7 miliardi di parametri quantizzato a 4 bit sta comodamente su una scheda da 16 GB e lascia spazio a una finestra di contesto utile; 13B vuole 24 GB; un modello da 70B con la stessa quantizzazione richiede circa 40-48 GB, oppure due schede. Servire a piena precisione a 16 bit raddoppia più o meno ciascuna di queste cifre.

Se un modello non ci sta, la risposta è la quantizzazione, un modello più piccolo o un'altra scheda - non lo swap sulla RAM di sistema, che trasforma un assistente interattivo in un lavoro batch.

Il software che si usa davvero

vLLM per servire ad alto throughput con un endpoint compatibile OpenAI, Ollama quando la comodità conta più dei token al secondo di picco, llama.cpp per l'impronta più leggera e PyTorch direttamente per tutto ciò che è su misura. Si installano tutti come su qualsiasi macchina Ubuntu, perché è esattamente ciò che è.

Inferenza o training: vogliono macchine diverse

L'inferenza è sensibile alla latenza ed è limitata soprattutto da VRAM e banda di memoria: una scheda, abbastanza capiente, e un percorso breve verso il client. Gira di continuo, quindi una macchina a canone mensile è la soluzione più economica.

Training e fine-tuning sono limitati dal throughput e arrivano a raffiche. Vogliono più schede, molta più RAM di sistema e NVMe capiente quanto il dataset. Se il lavoro è occasionale, dimensiona per il picco e restituisci la macchina invece di pagare silicio fermo.

IA privata, e dove stanno i dati

Il motivo per cui la maggior parte dei nostri clienti GPU è qui non è il prezzo. È che un modello in esecuzione su una macchina che affitti a Praga o a Covilhã non manda i prompt a terzi, non addestra il modello di qualcun altro con i tuoi documenti e si trova in una giurisdizione che puoi indicare in un accordo sul trattamento dei dati.

Conta per tutto ciò che tocca anagrafiche clienti, contratti, dati sanitari o finanziari: i carichi per cui un'API di inferenza pubblica è un problema di conformità prima ancora che tecnico.

Sedi e come ottenerne uno

Le macchine GPU sono fisiche e vengono costruite su ordine, quindi i tempi sono più lunghi di un server cloud: di' al supporto quale modello intendi servire e con quale concorrenza, e ti indicherà la scheda più piccola che ce la fa, non la più grande a magazzino.

Entrambe le sedi Tier III possono ospitarle, e la scelta segue i tuoi utenti come per qualsiasi altro server.

FAQ

Domande frequenti

Ottengo l'intera GPU o una quota di essa?

L'intera scheda. Un server GPU è una macchina dedicata con l'acceleratore collegato, insieme a CPU, RAM e NVMe necessari ad alimentarlo, che di solito è ciò che decide il throughput reale, più della scheda da sola

Quali dimensioni di modello stanno su quale scheda?

Il vincolo è la VRAM. Un modello da 7 miliardi di parametri quantizzato a 4 bit sta comodamente in 16 GB e lascia spazio a una finestra di contesto utile, 13B chiede 24 GB, e un modello da 70B con la stessa quantizzazione richiede circa 40-48 GB o due schede. Servire a piena precisione a 16 bit raddoppia all'incirca ogni cifra

Quali stack di serving sono supportati?

Qualunque cosa giri su Ubuntu con i driver NVIDIA: vLLM per servire ad alto throughput con un endpoint compatibile OpenAI, Ollama quando la comodità conta più del throughput di picco, llama.cpp per l'impronta più leggera, o PyTorch direttamente per lavori su misura

Un server GPU è meglio per l'inferenza o per il training?

Vogliono macchine diverse. L'inferenza è limitata dalla latenza e soprattutto dalla VRAM, quindi una scheda abbastanza capiente in funzione continua è la soluzione più economica. Training e fine-tuning sono limitati dal throughput e arrivano a raffiche: più schede, molta più RAM di sistema e NVMe capiente quanto il dataset

Dove finiscono i miei dati quando eseguo un modello qui?

Da nessuna parte. Il modello gira su una macchina che affitti a Praga o a Covilhã: i prompt non vengono inviati a terzi, nulla viene usato per addestrare il modello di altri e la giurisdizione è una che puoi indicare in un accordo sul trattamento dei dati

Quanto tempo serve per averne uno?

Più che per un server cloud, perché la macchina è fisica e viene costruita su ordine. Di' al supporto quale modello intendi servire e quale concorrenza prevedi, e dimensioneranno la scheda più piccola in grado di farlo, non la più grande a magazzino

Se hai bisogno di assistenza o hai domande aggiuntive, contatta i manager o scrivi al team di supporto a support@dcxv.com