Servidor cloud para Ollama en Europa: guía de IA autoalojada EU

Servidor cloud para Ollama en Europa: guía de IA autoalojada EU

Servidor cloud para Ollama en Europa: guía de IA autoalojada EU

Ollama es la forma más rápida de poner en marcha un LLM local: un solo comando instala el runtime, descarga un modelo y expone una API compatible con OpenAI. Para los equipos europeos, ejecutar Ollama en un servidor cloud de la UE significa que toda la inferencia de IA permanece bajo jurisdicción de la UE, cumpliendo con el RGPD.

Por que ejecutar Ollama en un servidor cloud de la UE

El hosting en la UE importa porque Ollama sirve como endpoint de inferencia para tus aplicaciones. Cada prompt que envían tus usuarios pasa por este servidor. Según el RGPD, si esos prompts contienen datos personales, la inferencia debe ocurrir en infraestructura bajo jurisdicción de la UE. Un servidor cloud DCXV EU con Ollama te da un endpoint de IA privado y conforme.

Elegir el modelo adecuado

  • llama3.1:8b - mejor para chat, resumen, Q&A. 4-5 GB VRAM en Q4.
  • llama3.1:70b - calidad cercana a GPT-4. Requiere 40+ GB VRAM.
  • mistral:7b - rápido, eficiente, excelente para salida estructurada.
  • nomic-embed-text - modelo de embedding para pipelines RAG. 274 MB.
  • codellama:13b - generación y revisión de código.
  • phi3:mini - muy rápido en CPU, útil para clasificación.

Especificaciones minimas para Ollama

  • Solo CPU (modelos pequeños, 7B Q4) - 8 vCPU, 16 GB RAM, 100 GB NVMe SSD
  • CPU producción (solicitudes paralelas) - 16 vCPU, 32 GB RAM, 200 GB NVMe SSD
  • GPU entrada (7B-13B a FP16) - 4 vCPU, 16 GB RAM, 16-24 GB VRAM
  • GPU producción (modelos 34B+) - 8 vCPU, 64 GB RAM, 40-80 GB VRAM

Configuración recomendada de DCXV

Los servidores cloud de DCXV funcionan en infraestructura Tier III en la UE:

  • Servidor CPU, 16 vCPU / 32 GB RAM - sirve modelos 7B a 18-28 tokens/s
  • Servidor GPU, 16-24 GB VRAM - sirve modelos 7B-13B a 80-120 tokens/s
  • Servidor GPU, 80 GB VRAM - sirve modelos 70B a 25-40 tokens/s

Contacta sales@dcxv.com para instancias GPU o CPU.

Comandos de configuración rápida

# Instalar Ollama en Ubuntu 22.04
curl -fsSL https://ollama.com/install.sh | sh

# Descargar modelos
ollama pull llama3.1:8b
ollama pull mistral:7b
ollama pull nomic-embed-text
ollama list
# Configurar Ollama para red privada
# /etc/systemd/system/ollama.service:
# Environment="OLLAMA_HOST=0.0.0.0:11434"
# Environment="OLLAMA_NUM_PARALLEL=4"

sudo systemctl daemon-reload && sudo systemctl restart ollama
curl http://10.0.0.5:11434/api/tags
# Usar la API compatible con OpenAI
curl http://10.0.0.5:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "llama3.1:8b",
    "messages": [{"role": "user", "content": "Que es el RGPD?"}]
  }'

Qué cuantización descargar

Cada modelo de arriba viene en varias compilaciones, y la etiqueta decide cuánto sobrevive de los pesos originales. ollama pull llama3.1:8b le da Q4_K_M - los 4,7 GB de los comandos anteriores - y ese valor por defecto acierta más veces de las que falla:

Compilación Un modelo de 8B necesita A qué renuncia Descárguela cuando
Q4_K_M unos 4,7 GB Poco que se note en chat o al resumir Es el valor por defecto, y el correcto para casi todo
Q5_K_M unos 5,7 GB Casi nada que usted note Tiene memoria de sobra y quiere usarla
Q8_0 unos 8,5 GB Nada que merezca mención Salida estructurada que debe parsearse siempre
fp16 unos 16 GB Nada, son los pesos originales Compara contra una referencia, o hace fine-tuning

La cifra con la que planificar no es el tamaño del archivo sino el tamaño del archivo más la ventana de contexto. Un modelo de 4,7 GB con contexto de 32k puede pedir otros dos o tres gigabytes para la caché KV, y así es como un modelo 7B en una máquina donde "16 GB sobran" acaba usando swap.

Rendimiento esperado

CPU (16 vCPU), llama3.1:8b Q4_K_M:

  • Generación (solicitud única) - 18-28 tokens/s
  • Throughput de embeddings - 250-400 vectores/s

GPU (16 GB VRAM), llama3.1:8b FP16:

  • Generación (solicitud única) - 80-120 tokens/s
  • Tiempo al primer token - 100-250 ms

Son expectativas para hardware de esta clase, no mediciones de nuestro propio laboratorio. Tómalas como punto de partida para dimensionar y mide tu propia carga: los números reales dependen de tus datos, tus consultas y tu ajuste mucho más que del proveedor.

Conclusión

Ollama en un servidor cloud DCXV de la UE da a tu equipo un endpoint de IA privado y conforme al RGPD. La instalación tarda menos de cinco minutos.

Cómo conectarte a tu nuevo servidor cloud por SSH
sshtutorialcloud

Cómo conectarte a tu nuevo servidor cloud por SSH

El servidor está listo y el panel muestra IP, usuario y contraseña. Aquí tienes la primera conexión SSH, los cuatro errores más comunes y los primeros diez minutos.

Cómo conectarte a un servidor Windows con Escritorio remoto
rdpwindowstutorialcloud

Cómo conectarte a un servidor Windows con Escritorio remoto

Tienes una dirección, un usuario y una contraseña. Así se convierten en un escritorio de Windows en tu pantalla, desde un PC, un Mac o un móvil, paso a paso.

Servidor cloud para Stable Diffusion en Europa: configuración GPU
cloudaigpu

Servidor cloud para Stable Diffusion en Europa: configuración GPU

Ejecuta Stable Diffusion en un servidor cloud EU compatible con GDPR. Cubre GPU, configuración de AUTOMATIC1111 y ComfyUI, almacenamiento de modelos y benchmarks.

Servidor cloud para hosting LLM en Europa: guía de IA RGPD
cloudaigpu

Servidor cloud para hosting LLM en Europa: guía de IA RGPD

Hospeda grandes modelos de lenguaje en un servidor cloud EU conforme al RGPD. Cubre requisitos GPU, cuantización, frameworks de API y benchmarks de rendimiento.

Ejecuta Claude Code, Codex y Grok CLI en tu propio servidor cloud
cloudaivps

Ejecuta Claude Code, Codex y Grok CLI en tu propio servidor cloud

Convierte un servidor cloud Debian o Ubuntu en un sandbox para agentes de IA como Claude Code, Codex y Grok CLI. Programa desde cualquier lugar.