Server cloud per hosting LLM in Europa: guida AI GDPR

Server cloud per hosting LLM in Europa: guida AI GDPR

Server cloud per hosting LLM in Europa: guida AI GDPR

Il self-hosting di un grande modello linguistico ti da il pieno controllo su quali dati entrano nel modello, dove vengono elaborati e chi può accedervi. Per le aziende europee, non e solo un argomento di costo - e un requisito di conformità. Qualsiasi prompt contenente dati personali di residenti UE deve essere elaborato sotto giurisdizione UE ai sensi del GDPR.

Perché la giurisdizione UE e importante per l'hosting LLM

Quando gli utenti interagiscono con un LLM - facendo domande, riassumendo documenti - quei prompt spesso contengono nomi, indirizzi email e altri dati personali. Inviarli a un'API ospitata negli USA significa che i dati personali lasciano la giurisdizione UE a ogni richiesta.

Il self-hosting su un server cloud DCXV EU significa che tutta l'inferenza rimane all'interno dei confini UE. Per le applicazioni sanitarie, legali e finanziarie in Europa, l'infrastruttura LLM self-hosted in UE e il percorso pratico verso la conformità GDPR.

Scegliere dimensione del modello e quantizzazione

  • Modelli 7B (Q4, ~4 GB VRAM) - riassunto, classificazione, Q&A su documenti
  • Modelli 13B (Q4, ~8 GB VRAM) - migliore ragionamento, migliore seguimento istruzioni
  • Modelli 34B (Q4, ~20 GB VRAM) - qualità vicina a GPT-3.5
  • Modelli 70B (Q4, ~40 GB VRAM) - classe GPT-4 per molti compiti

Specifiche minime per l'hosting LLM

  • Serving CPU (7B Q4) - 16 vCPU, 32 GB RAM, 200 GB NVMe SSD
  • GPU entry (7B-13B, RTX 4090) - 8 vCPU, 32 GB RAM, 24 GB VRAM, 500 GB NVMe
  • GPU medio (34B Q4, A100 40 GB) - 16 vCPU, 64 GB RAM, 40 GB VRAM, 1 TB NVMe
  • GPU alto (70B Q4, A100 80 GB) - 16 vCPU, 128 GB RAM, 80 GB VRAM, 2 TB NVMe

Configurazione DCXV raccomandata

I server cloud DCXV forniscono server EU dotati di GPU per l'hosting LLM:

  • Server GPU, 24 GB VRAM - modelli 7B-13B per copiloti SaaS
  • Server GPU, 80 GB VRAM - modelli 70B per API di produzione
  • Server CPU, 32-64 GB RAM - modelli 7B via llama.cpp per elaborazione in background

Contatta sales@dcxv.com per la disponibilità GPU.

Comandi di configurazione rapida

# Opzione 1: Ollama (più semplice)
curl -fsSL https://ollama.com/install.sh | sh
sudo systemctl enable --now ollama
ollama pull llama3.1:8b

# Esporre sulla rete privata:
# Environment="OLLAMA_HOST=0.0.0.0:11434"
sudo systemctl daemon-reload && sudo systemctl restart ollama
# Opzione 2: vLLM per GPU ad alto throughput
pip install vllm

python -m vllm.entrypoints.openai.api_server \
  --model metà-llama/Llama-3.1-8B-Instruct \
  --host 10.0.0.5 --port 8000 \
  --gpu-memory-utilization 0.90

Quale runtime di serving scegliere

I comandi sopra mostrano due modi di servire gli stessi pesi, e la scelta non riguarda la qualità - tutti eseguono lo stesso modello. Riguarda cosa succede quando la seconda richiesta arriva prima che la prima sia finita:

Runtime Richieste concorrenti Dove funziona meglio Scegli questo quando
Ollama In coda, una alla volta CPU o una singola GPU Strumenti interni, un utente, il più rapido da avviare
llama.cpp In coda, con un piccolo batch CPU, pesi GGUF Nessuna GPU, o lavoro batch notturno
vLLM Batch continuo Solo GPU Molti utenti condividono una GPU e conta il throughput
TGI Batch continuo Solo GPU Sei già sullo stack di Hugging Face

Il divario è più ampio di quanto sembri. Una GPU che serve una richiesta alla volta passa la maggior parte del tempo ad attendere la memoria, quindi un runtime che raggruppa le richieste può servire diverse volte più utenti sulla stessa scheda senza cambiare nulla nel modello. Per questo i numeri CPU e i numeri GPU qui sotto non sono la stessa misura scalata, ma forme di lavoro diverse.

Prestazioni attese

vLLM su RTX 4090, Llama 3.1 8B FP16:

  • Generazione (richiesta singola) - 80-120 token/s
  • Throughput in batch (8 concorrenti) - 400-700 token/s
  • Tempo al primo token - 150-300 ms

Queste sono aspettative per hardware di questa classe, non misurazioni dal nostro laboratorio. Prendile come punto di partenza per il dimensionamento e misura il tuo carico: i numeri reali dipendono dai tuoi dati, dalle tue query e dal tuo tuning molto più che dal fornitore.

Conclusione

Il self-hosting di LLM su infrastruttura EU e il percorso più affidabile verso un'AI conforme al GDPR in produzione.

Come connettersi al tuo nuovo server cloud via SSH
sshtutorialcloud

Come connettersi al tuo nuovo server cloud via SSH

Il server è pronto e il pannello mostra IP, login e password. Ecco la prima connessione SSH, i quattro errori più comuni e i primi dieci minuti.

Come connettersi a un server Windows con Desktop remoto
rdpwindowstutorialcloud

Come connettersi a un server Windows con Desktop remoto

Hai un indirizzo, un nome utente e una password. Ecco come diventano un desktop Windows sul tuo schermo, da un PC, un Mac o un telefono: è tutto qui, passo dopo passo.

Server cloud per Stable Diffusion in Europa: configurazione GPU
cloudaigpu

Server cloud per Stable Diffusion in Europa: configurazione GPU

Esegui Stable Diffusion su un server cloud EU conforme al GDPR. GPU, configurazione AUTOMATIC1111 e ComfyUI, storage modelli e benchmark di generazione immagini.

Server cloud per hosting LLM in Europa: guida AI GDPR
cloudaigpu

Server cloud per hosting LLM in Europa: guida AI GDPR

Ospita grandi modelli linguistici su un server cloud EU conforme al GDPR. GPU, quantizzazione, framework API e benchmark di throughput per l'Europa.

Esegui Claude Code, Codex e Grok CLI sul tuo server cloud
cloudaivps

Esegui Claude Code, Codex e Grok CLI sul tuo server cloud

Trasforma un server cloud Debian o Ubuntu in un sandbox per agenti IA come Claude Code, Codex e Grok CLI. Programma da qualsiasi luogo.