Propomos
Os nossos preços acessíveis
Apenas hardware de marca, controlo total, sem limites de tráfego, sem surpresas!
Servidores GPU NVIDIA para AI, aprendizagem automática e renderização em centros de dados Tier III da UE
Apenas hardware de marca, controlo total, sem limites de tráfego, sem surpresas!
Infraestrutura de nível empresarial com garantia de 99.9% de disponibilidade em localizações da UE
Coloque os seus servidores e recursos online em horas, não dias. Sem taxa de instalação
Operações em conformidade com RGPD com todos os dados armazenados em centros de dados europeus
Um servidor GPU é uma máquina dedicada com um ou mais aceleradores, nos nossos bastidores europeus. Recebe a placa inteira - não uma fracção repartida no tempo - juntamente com o CPU, a RAM e o NVMe necessários para a alimentar, que é normalmente o que decide o débito real.
As placas disponíveis mudam conforme o fornecimento, por isso a página de configuração é a lista honesta e não uma tabela fixa aqui. O que não muda é a forma: RAM de sistema suficiente para segurar um modelo enquanto carrega, NVMe rápido o bastante para que o carregamento de dados não seja o estrangulamento, e uma porta de rede por onde caiba um conjunto de dados.
A restrição prática é a VRAM. Um modelo de 7 mil milhões de parâmetros quantizado a 4 bits cabe folgadamente numa placa de 16 GB e deixa espaço para uma janela de contexto útil; 13B pede 24 GB; um modelo de 70B com a mesma quantização precisa de cerca de 40-48 GB, ou de duas placas. Servir em precisão total de 16 bits duplica aproximadamente cada um desses números.
Se um modelo não couber, a resposta é quantizar, usar um modelo mais pequeno ou outra placa - não recorrer à RAM do sistema, o que transforma um assistente interactivo num processo em lote.
vLLM para servir com débito elevado e um endpoint compatível com OpenAI, Ollama quando a conveniência importa mais do que o pico de tokens por segundo, llama.cpp para a menor pegada e PyTorch directamente para o que for à medida. Instalam-se todos como em qualquer máquina Ubuntu, porque é exactamente isso que é.
A inferência é sensível à latência e limitada sobretudo pela VRAM e pela largura de banda de memória: uma placa, suficientemente grande, e um caminho curto até ao cliente. Corre de forma contínua, por isso uma máquina mensal é o arranjo mais barato.
O treino e o ajuste fino são limitados pelo débito e chegam aos picos. Querem mais placas, muito mais RAM de sistema e NVMe com espaço para o conjunto de dados. Se o trabalho é ocasional, dimensione para o pico e devolva a máquina em vez de pagar silício parado.
A razão por que a maioria dos nossos clientes de GPU está aqui não é o preço. É que um modelo a correr numa máquina que aluga em Praga ou na Covilhã não envia prompts a terceiros, não treina o modelo de outra pessoa com os seus documentos e está numa jurisdição que pode nomear num contrato de tratamento de dados.
Isso importa em tudo o que toque registos de clientes, contratos, dados médicos ou financeiros - as cargas em que uma API pública de inferência é um problema de conformidade antes de ser técnico.
As máquinas GPU são físicas e construídas por encomenda, por isso o prazo é maior do que o de um servidor cloud: diga ao suporte que modelo tenciona servir e com que concorrência, e indicar-lhe-ão a placa mais pequena que o consegue, e não a maior em stock.
Ambos os sites Tier III as podem alojar, e a escolha segue os seus utilizadores tal como em qualquer outro servidor.
Perguntas frequentes
A placa inteira. Um servidor GPU é uma máquina dedicada com o acelerador ligado, juntamente com o CPU, a RAM e o NVMe necessários para o alimentar, e é normalmente isso que decide o débito real, mais do que a placa sozinha
A restrição é a VRAM. Um modelo de 7 mil milhões de parâmetros quantizado a 4 bits cabe folgadamente em 16 GB e deixa espaço para uma janela de contexto útil, 13B pede 24 GB, e um modelo de 70B com a mesma quantização precisa de cerca de 40-48 GB ou de duas placas. Servir em precisão total de 16 bits duplica aproximadamente cada número
Tudo o que corra em Ubuntu com controladores NVIDIA: vLLM para servir com débito elevado e um endpoint compatível com OpenAI, Ollama quando a conveniência importa mais do que o débito máximo, llama.cpp para a menor pegada, ou PyTorch directamente para trabalho à medida
Pedem máquinas diferentes. A inferência é limitada pela latência e sobretudo pela VRAM, por isso uma placa suficientemente grande a funcionar continuamente é o arranjo mais barato. O treino e o ajuste fino são limitados pelo débito e chegam aos picos: mais placas, muito mais RAM de sistema e NVMe com espaço para o conjunto de dados
Para lado nenhum. O modelo corre numa máquina que aluga em Praga ou na Covilhã: os prompts não são enviados a terceiros, nada é usado para treinar o modelo de outra pessoa e a jurisdição é uma que pode nomear num contrato de tratamento de dados
Mais do que um servidor cloud, porque a máquina é física e construída por encomenda. Diga ao suporte que modelo tenciona servir e que concorrência espera, e dimensionarão a placa mais pequena capaz de o fazer, em vez da maior que houver em stock
Se precisar de assistência ou tiver perguntas adicionais, por favor contacte os gestores ou escreva para a equipa de suporte em support@dcxv.com