Proponemos
Nuestros precios asequibles
Solo Hardware de Marca, Control Total, Sin Límites de Tráfico, Sin Sorpresas!
Servidores GPU NVIDIA para AI, aprendizaje automático y renderizado en centros de datos Tier III de la UE
Solo Hardware de Marca, Control Total, Sin Límites de Tráfico, Sin Sorpresas!
Infraestructura de nivel empresarial con garantía de 99.9% de tiempo de actividad en ubicaciones de la UE
Ponga sus servidores y recursos en línea en horas, no días. Sin tarifa de instalación
Operaciones compatibles con GDPR con todos los datos almacenados en centros de datos europeos
Un servidor GPU es una máquina dedicada con uno o varios aceleradores, en nuestros propios racks europeos. Recibes la tarjeta entera - no una fracción repartida en el tiempo - junto con la CPU, la RAM y el NVMe necesarios para alimentarla, que es lo que suele decidir el rendimiento real.
Las tarjetas disponibles cambian según el suministro, así que la página de configuración es la lista honesta y no una tabla fija en este texto. Lo que no cambia es la forma: RAM de sistema suficiente para sostener un modelo mientras carga, NVMe lo bastante rápido para que la carga de datos no sea el cuello de botella y un puerto de red por el que quepa un conjunto de datos.
La restricción práctica es la VRAM. Un modelo de 7B parámetros cuantizado a 4 bits cabe con holgura en una tarjeta de 16 GB y deja sitio para una ventana de contexto útil; 13B pide 24 GB; un modelo de 70B con la misma cuantización necesita unos 40-48 GB, o dos tarjetas. Servir con precisión completa de 16 bits duplica aproximadamente cada una de esas cifras.
Si un modelo no cabe, la respuesta es cuantizar, usar un modelo más pequeño u otra tarjeta, no tirar de la RAM del sistema, que convierte un asistente interactivo en un proceso por lotes.
vLLM para servir con alto rendimiento y un endpoint compatible con OpenAI, Ollama cuando la comodidad importa más que el máximo de tokens por segundo, llama.cpp para la huella más pequeña y PyTorch directamente para cualquier cosa a medida. Todos se instalan igual que en cualquier Ubuntu, porque eso es exactamente lo que es.
La inferencia es sensible a la latencia y la limitan sobre todo la VRAM y el ancho de banda de memoria: una tarjeta, suficientemente grande, y un camino corto hasta el cliente. Funciona de forma continua, así que una máquina mensual es el arreglo más barato.
El entrenamiento y el ajuste fino están limitados por rendimiento y llegan a ráfagas. Quieren más tarjetas, mucha más RAM de sistema y NVMe con espacio para el conjunto de datos. Si el trabajo es ocasional, dimensiona para el pico y devuelve la máquina después en lugar de pagar silicio parado.
La razón por la que la mayoría de nuestros clientes de GPU están aquí no es el precio. Es que un modelo que corre en una máquina que alquilas en Praga o Covilhã no envía prompts a terceros, no entrena el modelo de otro con tus documentos y está en una jurisdicción que puedes nombrar en un contrato de tratamiento de datos.
Eso importa en todo lo que toque registros de clientes, contratos o datos médicos o financieros: las cargas donde una API pública de inferencia es un problema de cumplimiento antes que uno técnico.
Las máquinas GPU son físicas y se fabrican bajo pedido, así que el plazo es mayor que el de un servidor cloud: dile a soporte qué modelo piensas servir y con qué concurrencia, y te dirá la tarjeta más pequeña que lo consigue, no la más grande que hay en stock.
Ambas sedes Tier III pueden alojarlas, y la elección sigue a tus usuarios igual que con cualquier otro servidor.
Preguntas frecuentes
La tarjeta entera. Un servidor GPU es una máquina dedicada con el acelerador conectado, junto con la CPU, la RAM y el NVMe necesarios para alimentarlo, que suele ser lo que decide el rendimiento real, más que la tarjeta por sí sola
La restricción es la VRAM. Un modelo de 7B parámetros cuantizado a 4 bits cabe con holgura en 16 GB y deja sitio para una ventana de contexto útil, 13B pide 24 GB, y un modelo de 70B con la misma cuantización necesita unos 40-48 GB o dos tarjetas. Servir con precisión completa de 16 bits duplica aproximadamente cada cifra
Cualquiera que corra sobre Ubuntu con controladores NVIDIA: vLLM para servir con alto rendimiento y un endpoint compatible con OpenAI, Ollama cuando la comodidad importa más que el rendimiento máximo, llama.cpp para la huella más pequeña, o PyTorch directamente para trabajo a medida
Piden máquinas distintas. La inferencia está limitada por latencia y sobre todo por la VRAM, así que una tarjeta suficientemente grande funcionando de forma continua es el arreglo más barato. El entrenamiento y el ajuste fino están limitados por rendimiento y llegan a ráfagas: más tarjetas, mucha más RAM de sistema y NVMe con espacio para el conjunto de datos
A ninguna parte. El modelo corre en una máquina que alquilas en Praga o Covilhã: los prompts no se envían a terceros, nada se usa para entrenar el modelo de otro y la jurisdicción es una que puedes nombrar en un acuerdo de tratamiento de datos
Más que un servidor cloud, porque la máquina es física y se fabrica bajo pedido. Dile a soporte qué modelo piensas servir y qué concurrencia esperas, y dimensionarán la tarjeta más pequeña capaz de hacerlo, en lugar de la más grande que haya en stock
Si necesita asistencia o tiene preguntas adicionales, por favor contacte a los gerentes o escriba al equipo de soporte en support@dcxv.com