Servidores GPU em Portugal

Servidores GPU NVIDIA para AI, aprendizagem automática e renderização em centros de dados Tier III da UE

Certificado Tier III ISO 9001 ISO/IEC 27001 ISO 14001 Conforme com o RGPD

Propomos

Os nossos preços acessíveis

Apenas hardware de marca, controlo total, sem limites de tráfego, sem surpresas!

1
1
1
1
IP 1 IP
1 IP min max 7 IP
Meses pagos antecipadamente 6 month
6 month min max 12 month

Porquê escolher-nos

Centros de dados TIER III

Infraestrutura de nível empresarial com garantia de 99.9% de disponibilidade em localizações da UE

Implementação instantânea

Coloque os seus servidores e recursos online em horas, não dias. Sem taxa de instalação

Conformidade UE

Operações em conformidade com RGPD com todos os dados armazenados em centros de dados europeus

Servidores GPU para inferência, treino e renderização

Um servidor GPU é uma máquina dedicada com um ou mais aceleradores, nos nossos bastidores europeus. Recebe a placa inteira - não uma fracção repartida no tempo - juntamente com o CPU, a RAM e o NVMe necessários para a alimentar, que é normalmente o que decide o débito real.

As placas disponíveis mudam conforme o fornecimento, por isso a página de configuração é a lista honesta e não uma tabela fixa aqui. O que não muda é a forma: RAM de sistema suficiente para segurar um modelo enquanto carrega, NVMe rápido o bastante para que o carregamento de dados não seja o estrangulamento, e uma porta de rede por onde caiba um conjunto de dados.

Que tamanhos de modelo cabem em que placa

A restrição prática é a VRAM. Um modelo de 7 mil milhões de parâmetros quantizado a 4 bits cabe folgadamente numa placa de 16 GB e deixa espaço para uma janela de contexto útil; 13B pede 24 GB; um modelo de 70B com a mesma quantização precisa de cerca de 40-48 GB, ou de duas placas. Servir em precisão total de 16 bits duplica aproximadamente cada um desses números.

Se um modelo não couber, a resposta é quantizar, usar um modelo mais pequeno ou outra placa - não recorrer à RAM do sistema, o que transforma um assistente interactivo num processo em lote.

O software que é realmente usado

vLLM para servir com débito elevado e um endpoint compatível com OpenAI, Ollama quando a conveniência importa mais do que o pico de tokens por segundo, llama.cpp para a menor pegada e PyTorch directamente para o que for à medida. Instalam-se todos como em qualquer máquina Ubuntu, porque é exactamente isso que é.

Inferência ou treino: pedem máquinas diferentes

A inferência é sensível à latência e limitada sobretudo pela VRAM e pela largura de banda de memória: uma placa, suficientemente grande, e um caminho curto até ao cliente. Corre de forma contínua, por isso uma máquina mensal é o arranjo mais barato.

O treino e o ajuste fino são limitados pelo débito e chegam aos picos. Querem mais placas, muito mais RAM de sistema e NVMe com espaço para o conjunto de dados. Se o trabalho é ocasional, dimensione para o pico e devolva a máquina em vez de pagar silício parado.

IA privada, e onde ficam os dados

A razão por que a maioria dos nossos clientes de GPU está aqui não é o preço. É que um modelo a correr numa máquina que aluga em Praga ou na Covilhã não envia prompts a terceiros, não treina o modelo de outra pessoa com os seus documentos e está numa jurisdição que pode nomear num contrato de tratamento de dados.

Isso importa em tudo o que toque registos de clientes, contratos, dados médicos ou financeiros - as cargas em que uma API pública de inferência é um problema de conformidade antes de ser técnico.

Localizações e como obter um

As máquinas GPU são físicas e construídas por encomenda, por isso o prazo é maior do que o de um servidor cloud: diga ao suporte que modelo tenciona servir e com que concorrência, e indicar-lhe-ão a placa mais pequena que o consegue, e não a maior em stock.

Ambos os sites Tier III as podem alojar, e a escolha segue os seus utilizadores tal como em qualquer outro servidor.

FAQ

Perguntas frequentes

Recebo a GPU inteira ou uma parte dela?

A placa inteira. Um servidor GPU é uma máquina dedicada com o acelerador ligado, juntamente com o CPU, a RAM e o NVMe necessários para o alimentar, e é normalmente isso que decide o débito real, mais do que a placa sozinha

Que tamanhos de modelo cabem em que placa?

A restrição é a VRAM. Um modelo de 7 mil milhões de parâmetros quantizado a 4 bits cabe folgadamente em 16 GB e deixa espaço para uma janela de contexto útil, 13B pede 24 GB, e um modelo de 70B com a mesma quantização precisa de cerca de 40-48 GB ou de duas placas. Servir em precisão total de 16 bits duplica aproximadamente cada número

Que stacks de serving são suportadas?

Tudo o que corra em Ubuntu com controladores NVIDIA: vLLM para servir com débito elevado e um endpoint compatível com OpenAI, Ollama quando a conveniência importa mais do que o débito máximo, llama.cpp para a menor pegada, ou PyTorch directamente para trabalho à medida

Um servidor GPU é melhor para inferência ou para treino?

Pedem máquinas diferentes. A inferência é limitada pela latência e sobretudo pela VRAM, por isso uma placa suficientemente grande a funcionar continuamente é o arranjo mais barato. O treino e o ajuste fino são limitados pelo débito e chegam aos picos: mais placas, muito mais RAM de sistema e NVMe com espaço para o conjunto de dados

Para onde vão os meus dados quando corro um modelo aqui?

Para lado nenhum. O modelo corre numa máquina que aluga em Praga ou na Covilhã: os prompts não são enviados a terceiros, nada é usado para treinar o modelo de outra pessoa e a jurisdição é uma que pode nomear num contrato de tratamento de dados

Quanto tempo demora a obter um?

Mais do que um servidor cloud, porque a máquina é física e construída por encomenda. Diga ao suporte que modelo tenciona servir e que concorrência espera, e dimensionarão a placa mais pequena capaz de o fazer, em vez da maior que houver em stock

Se precisar de assistência ou tiver perguntas adicionais, por favor contacte os gestores ou escreva para a equipa de suporte em support@dcxv.com