Servidor cloud para Ollama na Europa: guia de IA auto-hospedada EU
Ollama e a forma mais rápida de colocar um LLM local em funcionamento - um único comando instala o runtime, baixa um modelo e expoe uma API compatível com OpenAI. Para equipes europeias, executar Ollama em um servidor cloud da UE significa que toda a inferência de IA permanece sob jurisdição da UE, satisfazendo os requisitos do RGPD.
Por que executar Ollama em um servidor cloud da UE
O hosting na UE importa porque Ollama serve como endpoint de inferência para suas aplicações. Cada prompt enviado pelos seus usuários passa por este servidor. Sob o RGPD, se esses prompts contiverem dados pessoais, a inferência deve ocorrer em infraestrutura sob jurisdição da UE. Um servidor cloud DCXV da UE com Ollama fornece um endpoint de IA privado e em conformidade.
Escolhendo o modelo certo
- llama3.1:8b - melhor para chat, resumo, Q&A. 4-5 GB VRAM em Q4.
- llama3.1:70b - qualidade próxima ao GPT-4. Requer 40+ GB VRAM.
- mistral:7b - rápido, eficiente, excelente para saida estruturada.
- nomic-embed-text - modelo de embedding para pipelines RAG. 274 MB.
- codellama:13b - geração e revisão de codigo.
- phi3:mini - muito rápido em CPU, útil para classificação.
Especificações mínimas para Ollama
- Somente CPU (modelos pequenos, 7B Q4) - 8 vCPU, 16 GB RAM, 100 GB NVMe SSD
- CPU produção (solicitações paralelas) - 16 vCPU, 32 GB RAM, 200 GB NVMe SSD
- GPU entrada (7B-13B em FP16) - 4 vCPU, 16 GB RAM, 16-24 GB VRAM
- GPU produção (modelos 34B+) - 8 vCPU, 64 GB RAM, 40-80 GB VRAM
Configuração recomendada da DCXV
Os servidores cloud da DCXV funcionam em infraestrutura Tier III na UE:
- Servidor CPU, 16 vCPU / 32 GB RAM - serve modelos 7B a 18-28 tokens/s
- Servidor GPU, 16-24 GB VRAM - serve modelos 7B-13B a 80-120 tokens/s
- Servidor GPU, 80 GB VRAM - serve modelos 70B a 25-40 tokens/s
Contate sales@dcxv.com para instâncias GPU ou CPU.
Comandos de configuração rápida
# Instalar Ollama no Ubuntu 22.04
curl -fsSL https://ollama.com/install.sh | sh
# Baixar modelos
ollama pull llama3.1:8b
ollama pull mistral:7b
ollama pull nomic-embed-text
ollama list
# Configurar Ollama para rede privada
# /etc/systemd/system/ollama.service:
# Environment="OLLAMA_HOST=0.0.0.0:11434"
# Environment="OLLAMA_NUM_PARALLEL=4"
sudo systemctl daemon-reload && sudo systemctl restart ollama
curl http://10.0.0.5:11434/api/tags
# Usar a API compatível com OpenAI
curl http://10.0.0.5:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "llama3.1:8b",
"messages": [{"role": "user", "content": "O que e RGPD?"}]
}'
Qual quantização baixar
Cada modelo acima vem em várias compilações, e a tag decide quanto sobra dos pesos originais. ollama pull llama3.1:8b entrega Q4_K_M - os 4,7 GB dos comandos acima - e esse padrão acerta mais vezes do que erra:
| Compilação | Um modelo de 8B precisa | Do que você desiste | Baixe quando |
|---|---|---|---|
| Q4_K_M | cerca de 4,7 GB | Pouco que apareça em chat ou ao resumir | É o padrão, e o certo para a maior parte do trabalho |
| Q5_K_M | cerca de 5,7 GB | Quase nada que você perceba | Há memória sobrando e você quer usá-la |
| Q8_0 | cerca de 8,5 GB | Nada que mereça menção | Saída estruturada que precisa ser parseada sempre |
| fp16 | cerca de 16 GB | Nada, são os pesos originais | Comparando com uma referência, ou fazendo fine-tuning |
O número para planejar não é o tamanho do arquivo, e sim o tamanho do arquivo mais a janela de contexto. Um modelo de 4,7 GB com contexto de 32k pode pedir outros dois ou três gigabytes para o cache KV, e é assim que um modelo 7B numa máquina onde "16 GB é bastante" acaba usando swap.
Desempenho esperado
CPU (16 vCPU), llama3.1:8b Q4_K_M:
- Geração (solicitação única) - 18-28 tokens/s
- Throughput de embeddings - 250-400 vetores/s
GPU (16 GB VRAM), llama3.1:8b FP16:
- Geração (solicitação única) - 80-120 tokens/s
- Tempo ao primeiro token - 100-250 ms
Estas são expectativas para hardware desta classe, não medições do nosso próprio laboratório. Use-as como ponto de partida para o dimensionamento e meça a sua própria carga: os números reais dependem dos seus dados, das suas consultas e do seu tuning muito mais do que do fornecedor.
Conclusão
Ollama em um servidor cloud DCXV da UE fornece a sua equipe um endpoint de IA privado e em conformidade com o RGPD. A instalação leva menos de cinco minutos.
