Servidor cloud para Ollama na Europa: guia de IA auto-hospedada EU

Servidor cloud para Ollama na Europa: guia de IA auto-hospedada EU

Servidor cloud para Ollama na Europa: guia de IA auto-hospedada EU

Ollama e a forma mais rápida de colocar um LLM local em funcionamento - um único comando instala o runtime, baixa um modelo e expoe uma API compatível com OpenAI. Para equipes europeias, executar Ollama em um servidor cloud da UE significa que toda a inferência de IA permanece sob jurisdição da UE, satisfazendo os requisitos do RGPD.

Por que executar Ollama em um servidor cloud da UE

O hosting na UE importa porque Ollama serve como endpoint de inferência para suas aplicações. Cada prompt enviado pelos seus usuários passa por este servidor. Sob o RGPD, se esses prompts contiverem dados pessoais, a inferência deve ocorrer em infraestrutura sob jurisdição da UE. Um servidor cloud DCXV da UE com Ollama fornece um endpoint de IA privado e em conformidade.

Escolhendo o modelo certo

  • llama3.1:8b - melhor para chat, resumo, Q&A. 4-5 GB VRAM em Q4.
  • llama3.1:70b - qualidade próxima ao GPT-4. Requer 40+ GB VRAM.
  • mistral:7b - rápido, eficiente, excelente para saida estruturada.
  • nomic-embed-text - modelo de embedding para pipelines RAG. 274 MB.
  • codellama:13b - geração e revisão de codigo.
  • phi3:mini - muito rápido em CPU, útil para classificação.

Especificações mínimas para Ollama

  • Somente CPU (modelos pequenos, 7B Q4) - 8 vCPU, 16 GB RAM, 100 GB NVMe SSD
  • CPU produção (solicitações paralelas) - 16 vCPU, 32 GB RAM, 200 GB NVMe SSD
  • GPU entrada (7B-13B em FP16) - 4 vCPU, 16 GB RAM, 16-24 GB VRAM
  • GPU produção (modelos 34B+) - 8 vCPU, 64 GB RAM, 40-80 GB VRAM

Configuração recomendada da DCXV

Os servidores cloud da DCXV funcionam em infraestrutura Tier III na UE:

  • Servidor CPU, 16 vCPU / 32 GB RAM - serve modelos 7B a 18-28 tokens/s
  • Servidor GPU, 16-24 GB VRAM - serve modelos 7B-13B a 80-120 tokens/s
  • Servidor GPU, 80 GB VRAM - serve modelos 70B a 25-40 tokens/s

Contate sales@dcxv.com para instâncias GPU ou CPU.

Comandos de configuração rápida

# Instalar Ollama no Ubuntu 22.04
curl -fsSL https://ollama.com/install.sh | sh

# Baixar modelos
ollama pull llama3.1:8b
ollama pull mistral:7b
ollama pull nomic-embed-text
ollama list
# Configurar Ollama para rede privada
# /etc/systemd/system/ollama.service:
# Environment="OLLAMA_HOST=0.0.0.0:11434"
# Environment="OLLAMA_NUM_PARALLEL=4"

sudo systemctl daemon-reload && sudo systemctl restart ollama
curl http://10.0.0.5:11434/api/tags
# Usar a API compatível com OpenAI
curl http://10.0.0.5:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "llama3.1:8b",
    "messages": [{"role": "user", "content": "O que e RGPD?"}]
  }'

Qual quantização baixar

Cada modelo acima vem em várias compilações, e a tag decide quanto sobra dos pesos originais. ollama pull llama3.1:8b entrega Q4_K_M - os 4,7 GB dos comandos acima - e esse padrão acerta mais vezes do que erra:

Compilação Um modelo de 8B precisa Do que você desiste Baixe quando
Q4_K_M cerca de 4,7 GB Pouco que apareça em chat ou ao resumir É o padrão, e o certo para a maior parte do trabalho
Q5_K_M cerca de 5,7 GB Quase nada que você perceba Há memória sobrando e você quer usá-la
Q8_0 cerca de 8,5 GB Nada que mereça menção Saída estruturada que precisa ser parseada sempre
fp16 cerca de 16 GB Nada, são os pesos originais Comparando com uma referência, ou fazendo fine-tuning

O número para planejar não é o tamanho do arquivo, e sim o tamanho do arquivo mais a janela de contexto. Um modelo de 4,7 GB com contexto de 32k pode pedir outros dois ou três gigabytes para o cache KV, e é assim que um modelo 7B numa máquina onde "16 GB é bastante" acaba usando swap.

Desempenho esperado

CPU (16 vCPU), llama3.1:8b Q4_K_M:

  • Geração (solicitação única) - 18-28 tokens/s
  • Throughput de embeddings - 250-400 vetores/s

GPU (16 GB VRAM), llama3.1:8b FP16:

  • Geração (solicitação única) - 80-120 tokens/s
  • Tempo ao primeiro token - 100-250 ms

Estas são expectativas para hardware desta classe, não medições do nosso próprio laboratório. Use-as como ponto de partida para o dimensionamento e meça a sua própria carga: os números reais dependem dos seus dados, das suas consultas e do seu tuning muito mais do que do fornecedor.

Conclusão

Ollama em um servidor cloud DCXV da UE fornece a sua equipe um endpoint de IA privado e em conformidade com o RGPD. A instalação leva menos de cinco minutos.

Como se conectar ao seu novo servidor cloud por SSH
sshtutorialcloud

Como se conectar ao seu novo servidor cloud por SSH

O servidor está pronto e o painel mostra IP, login e senha. Aqui está a primeira conexão SSH, os quatro erros mais comuns e os primeiros dez minutos.

Como se conectar a um servidor Windows com a Área de Trabalho Remota
rdpwindowstutorialcloud

Como se conectar a um servidor Windows com a Área de Trabalho Remota

Você tem um endereço, um usuário e uma senha. Veja como transformá-los em uma área de trabalho do Windows na sua tela, de um PC, Mac ou celular, passo a passo.

Servidor cloud para Stable Diffusion na Europa: configuração GPU
cloudaigpu

Servidor cloud para Stable Diffusion na Europa: configuração GPU

Execute Stable Diffusion em um servidor cloud da UE em conformidade com o RGPD. GPU, configuração AUTOMATIC1111 e ComfyUI, armazenamento de modelos e benchmarks.

Servidor cloud para hosting LLM na Europa: guia de IA RGPD
cloudaigpu

Servidor cloud para hosting LLM na Europa: guia de IA RGPD

Hospede grandes modelos de linguagem em um servidor cloud da UE em conformidade com o RGPD. GPU, quantização, frameworks de API e benchmarks para a Europa.

Execute Claude Code, Codex e Grok CLI no seu próprio servidor cloud
cloudaivps

Execute Claude Code, Codex e Grok CLI no seu próprio servidor cloud

Transforme um servidor cloud Debian ou Ubuntu num sandbox para agentes de IA como Claude Code, Codex e Grok CLI. Programe a partir de qualquer lugar.