Server cloud per Ollama in Europa: guida AI self-hosted EU

Server cloud per Ollama in Europa: guida AI self-hosted EU

Server cloud per Ollama in Europa: guida AI self-hosted EU

Ollama e il modo più veloce per far girare un LLM locale - un singolo comando installa il runtime, scarica un modello ed espone un'API compatibile con OpenAI. Per i team europei, eseguire Ollama su un server cloud EU significa che tutta l'inferenza AI rimane sotto giurisdizione UE, soddisfacendo i requisiti GDPR.

Perché eseguire Ollama su un server cloud EU

L'hosting EU e importante perché Ollama funge da endpoint di inferenza per le tue applicazioni. Ogni prompt inviato dai tuoi utenti passa attraverso questo server. Ai sensi del GDPR, se quei prompt contengono dati personali, l'inferenza deve avvenire su infrastruttura sotto giurisdizione UE. Un server cloud DCXV EU con Ollama ti da un endpoint AI privato e conforme.

Scegliere il modello giusto

  • llama3.1:8b - migliore per chat, riassunto, Q&A. 4-5 GB VRAM in Q4.
  • llama3.1:70b - qualità vicina a GPT-4. Richiede 40+ GB VRAM.
  • mistral:7b - veloce, efficiente, eccellente per output strutturato.
  • nomic-embed-text - modello di embedding per pipeline RAG. 274 MB.
  • codellama:13b - generazione e revisione di codice.
  • phi3:mini - molto veloce su CPU, utile per la classificazione.

Specifiche minime per Ollama

  • Solo CPU (modelli piccoli, 7B Q4) - 8 vCPU, 16 GB RAM, 100 GB NVMe SSD
  • CPU produzione (richieste parallele) - 16 vCPU, 32 GB RAM, 200 GB NVMe SSD
  • GPU entry (7B-13B a FP16) - 4 vCPU, 16 GB RAM, 16-24 GB VRAM
  • GPU produzione (modelli 34B+) - 8 vCPU, 64 GB RAM, 40-80 GB VRAM

Configurazione DCXV raccomandata

I server cloud DCXV funzionano su infrastruttura Tier III in UE:

  • Server CPU, 16 vCPU / 32 GB RAM - serve modelli 7B a 18-28 token/s
  • Server GPU, 16-24 GB VRAM - serve modelli 7B-13B a 80-120 token/s
  • Server GPU, 80 GB VRAM - serve modelli 70B a 25-40 token/s

Contatta sales@dcxv.com per istanze GPU o CPU.

Comandi di configurazione rapida

# Installare Ollama su Ubuntu 22.04
curl -fsSL https://ollama.com/install.sh | sh

# Scaricare modelli
ollama pull llama3.1:8b
ollama pull mistral:7b
ollama pull nomic-embed-text
ollama list
# Configurare Ollama per la rete privata
# /etc/systemd/system/ollama.service:
# Environment="OLLAMA_HOST=0.0.0.0:11434"
# Environment="OLLAMA_NUM_PARALLEL=4"

sudo systemctl daemon-reload && sudo systemctl restart ollama
curl http://10.0.0.5:11434/api/tags
# Usare l'API compatibile con OpenAI
curl http://10.0.0.5:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "llama3.1:8b",
    "messages": [{"role": "user", "content": "Cosè il GDPR?"}]
  }'

Quale quantizzazione scaricare

Ogni modello sopra esiste in più build, e il tag decide quanto sopravvive dei pesi originali. ollama pull llama3.1:8b ti dà Q4_K_M - i 4,7 GB dei comandi sopra - e quel valore predefinito ha ragione più spesso di quanto sbagli:

Build Un modello 8B richiede A cosa rinunci Scaricala quando
Q4_K_M circa 4,7 GB Poco che si noti in chat o riassumendo È il predefinito, e giusto per la maggior parte del lavoro
Q5_K_M circa 5,7 GB Quasi nulla che noteresti La memoria è libera e vuoi usarla
Q8_0 circa 8,5 GB Nulla che valga la pena nominare Output strutturato che deve essere analizzato ogni volta
fp16 circa 16 GB Nulla, sono i pesi originali Stai confrontando con un riferimento, o fai fine-tuning

Il numero su cui pianificare non è la dimensione del file ma la dimensione del file più la finestra di contesto. Un modello da 4,7 GB con contesto 32k può chiedere altri due o tre gigabyte per la cache KV, ed è così che un modello 7B su una macchina dove "16 GB bastano" finisce per usare lo swap.

Prestazioni attese

CPU (16 vCPU), llama3.1:8b Q4_K_M:

  • Generazione (richiesta singola) - 18-28 token/s
  • Throughput embedding - 250-400 vettori/s

GPU (16 GB VRAM), llama3.1:8b FP16:

  • Generazione (richiesta singola) - 80-120 token/s
  • Tempo al primo token - 100-250 ms

Queste sono aspettative per hardware di questa classe, non misurazioni dal nostro laboratorio. Prendile come punto di partenza per il dimensionamento e misura il tuo carico: i numeri reali dipendono dai tuoi dati, dalle tue query e dal tuo tuning molto più che dal fornitore.

Conclusione

Ollama su un server cloud DCXV EU fornisce al tuo team un endpoint AI privato e conforme al GDPR. L'installazione richiede meno di cinque minuti.

Come connettersi al tuo nuovo server cloud via SSH
sshtutorialcloud

Come connettersi al tuo nuovo server cloud via SSH

Il server è pronto e il pannello mostra IP, login e password. Ecco la prima connessione SSH, i quattro errori più comuni e i primi dieci minuti.

Come connettersi a un server Windows con Desktop remoto
rdpwindowstutorialcloud

Come connettersi a un server Windows con Desktop remoto

Hai un indirizzo, un nome utente e una password. Ecco come diventano un desktop Windows sul tuo schermo, da un PC, un Mac o un telefono: è tutto qui, passo dopo passo.

Server cloud per Stable Diffusion in Europa: configurazione GPU
cloudaigpu

Server cloud per Stable Diffusion in Europa: configurazione GPU

Esegui Stable Diffusion su un server cloud EU conforme al GDPR. GPU, configurazione AUTOMATIC1111 e ComfyUI, storage modelli e benchmark di generazione immagini.

Server cloud per hosting LLM in Europa: guida AI GDPR
cloudaigpu

Server cloud per hosting LLM in Europa: guida AI GDPR

Ospita grandi modelli linguistici su un server cloud EU conforme al GDPR. GPU, quantizzazione, framework API e benchmark di throughput per l'Europa.

Esegui Claude Code, Codex e Grok CLI sul tuo server cloud
cloudaivps

Esegui Claude Code, Codex e Grok CLI sul tuo server cloud

Trasforma un server cloud Debian o Ubuntu in un sandbox per agenti IA come Claude Code, Codex e Grok CLI. Programma da qualsiasi luogo.