Quanto custa um servidor GPU para LLM? Compra, aluguel, API
O custo de um servidor GPU para LLM não se resume ao preço de uma placa gráfica. Entre comprar uma máquina dedicada, alugar em um provedor de hospedagem ou chamar uma API na nuvem, os perfis de despesa são radicalmente diferentes: investimento inicial alto versus fatura mensal, custo fixo versus custo variável. Este guia apresenta as ordens de grandeza de 2026, o ponto de equilíbrio entre hospedagem própria e API e configurações típicas por orçamento.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Boa relação custo-benefício para IA local: um GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.
Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Orçamento apertado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#As 3 opções e seus perfis de custo
Antes de falar de números, é preciso entender que o custo de um servidor GPU para LLM se divide em três modelos econômicos muito diferentes. A escolha certa não depende apenas do seu orçamento, mas principalmente do volume de uso e da sensibilidade dos seus dados.
- Compra (CAPEX)
- Você investe uma quantia elevada de uma só vez para ter sua própria máquina. Depois, o custo marginal é quase nulo (eletricidade). Compensa se você usar a máquina com frequência e por muito tempo.
- Aluguel (OPEX mensal)
- Um servidor GPU dedicado ou uma VM em um provedor, cobrado por mês ou por hora. Sem investimento, mas com fatura recorrente enquanto a máquina estiver rodando.
- API na nuvem (OPEX por token)
- Você não gerencia nenhuma máquina, paga por uso (por milhão de tokens). Sem custo fixo, mas o preço aumenta linearmente com o uso.
#Comprar uma máquina dedicada
A compra é o modelo clássico de auto-hospedagem: uma máquina em sua casa ou em sua sala técnica, que você amortiza em 2 a 4 anos. O custo se concentra na GPU, que muitas vezes representa mais da metade do orçamento total da máquina.
- GPU de entrada — RTX 3060 12 GB
- Aproximadamente 300 € de segunda mão. Roda modelos de 7B a 14B em Q4 com conforto. O preço de entrada para um LLM local sério.
- GPU multifuncional — RTX 4070 / 4080 16 GB
- 700 a 1.200 €. Modelos 14B rodam com fluidez, e modelos 32B em Q4 têm um pouco de margem (19 GB de VRAM na 4080… bem no limite).
- GPU de alto desempenho — RTX 4090 24 GB
- 1 600 a 2 000 €. Executa um 32B Q4 (≈19 GB) com bastante folga e um 70B com quantização agressiva. A referência para estações de trabalho.
- Memória unificada — Mac Studio / M4 Pro 48–128 GB
- De 2.000 a 6.000 €. A VRAM unificada permite carregar modelos de 70B ou até maiores, sem necessidade de várias GPUs. Silencioso e econômico em energia.
A isso se soma o restante da máquina: placa-mãe, CPU, 32 a 64 GB de RAM, fonte robusta (750 W+ para uma 4090) e gabinete ventilado. Conte com 500 a 900 € para uma boa base de PC que acomode a GPU. Uma estação de trabalho completa com GPU capaz de rodar modelos de 32B custa, portanto, entre 2.500 e 3.500 €, com tudo incluído.
#Alugar um servidor com GPU em um provedor
O aluguel evita o investimento inicial e o problema da obsolescência. Duas subcategorias: o servidor com GPU dedicado alugado por mês (você reserva a máquina continuamente) e a GPU por hora no modelo de nuvem (você paga apenas pelas horas de inferência).
- GPU dedicada com aluguel mensal — provedor de hospedagem francês
- Na OVHcloud ou na Scaleway, o aluguel de um servidor com GPU dedicada custa de algumas centenas a mais de mil euros por mês, dependendo da placa (L4, L40S, H100). Dados hospedados na França: um argumento em termos de soberania e RGPD.
- GPU por hora — nuvem spot
- Em plataformas como RunPod, Vast.ai e Lambda, é possível alugar uma GPU por 0,20 a 3 €/h, dependendo da placa. Ideal para processamento ocasional em lote ou fine-tuning, não para uso 24/7.
- VM com GPU em uma nuvem de uso geral
- AWS, GCP e Azure cobram por hora de uso da instância de GPU, muitas vezes mais caro que os provedores especializados, mas oferecem o ecossistema e o SLA de um grande provedor de nuvem.
Regra simples: para uma carga intermitente (algumas horas por dia, processamento em lote, experimentação), o aluguel por hora é mais vantajoso. Para um serviço que precisa responder continuamente, o aluguel mensal de uma GPU dedicada ou a compra passam a ser mais vantajosos já no segundo ou terceiro mês.
#Passar por uma API na nuvem
A API é a opção sem servidor: você não compra nem aluga uma GPU, paga por token consumido. É o ponto de partida mais racional quando o volume é baixo ou imprevisível, pois o custo fixo é nulo.
- Modelo de cobrança
- Preço por milhão de tokens de entrada e saída. Os tokens de saída geralmente custam mais que os de entrada.
- Vantagem
- Sem manutenção, sem obsolescência, acesso imediato a modelos de 100B+ impossíveis de rodar em uma estação de trabalho.
- Desvantagem de custo
- O preço sobe linearmente com o uso. Um pipeline que processa 100.000 documentos por dia transforma uma API “barata” em uma fatura mensal de quatro dígitos.
- Desvantagem de privacidade
- Seus prompts saem da sua infraestrutura. Isso inviabiliza o uso com dados sensíveis (saúde, área jurídica, código proprietário) sem contrato e uma nuvem dedicada adequada.
#O ponto de equilíbrio entre hospedagem própria e API
É o cálculo central. Uma GPU comprada é um custo fixo; uma API é um custo variável. Existe, portanto, um volume de tokens a partir do qual ter seu próprio servidor sai mais barato do que pagar por uso. Abaixo desse limite, a API é mais vantajosa; acima, o investimento em hospedagem própria se amortiza.
A ideia: uma RTX 4090 de 1.800 € amortizada em 3 anos equivale a cerca de 50 €/mês de equipamento, mais a energia elétrica. Se o gasto com a API ultrapassar esse valor mensalmente, a compra se torna rentável — muitas vezes a partir de alguns milhões de tokens por dia em uso recorrente. Para uso ocasional de algumas requisições por dia, a API continua imbatível.
- Baixo volume, dados não sensíveis
- API. O custo fixo de um servidor não se justifica para alguns milhares de tokens por dia.
- Volume elevado e recorrente
- Compra. O investimento na GPU se paga em alguns meses e o custo marginal por requisição cai para quase zero.
- Dados sensíveis, independentemente do volume
- Hospedagem própria (compra ou locação na França). A confidencialidade determina a escolha antes mesmo do cálculo do custo.
- Pico pontual ou fine-tuning
- Aluguel por hora. Paga-se pela capacidade de processamento apenas durante a operação.
#Configuração típica por orçamento
Aqui estão três perfis de máquinas auto-hospedadas correspondentes a três níveis de orçamento e de ambição. As faixas de preço são estimativas para 2026, com todo o hardware incluído.
- 01Estação de trabalho com GPU — entre 2.500 e 3.500 €Uma RTX 4090 de 24 GB (ou uma RTX 3090 de segunda mão para dividir o preço por dois) em um PC com 64 GB de RAM. Executa com conforto um 32B Q4 (≈19 GB de VRAM) e um 70B com quantização agressiva. A referência para um desenvolvedor ou pequena equipe.
- 02Servidor dedicado de GPU — de 4.000 a 8.000 € ou aluguel mensalUma placa profissional (L40S 48 GB, ou 2× RTX 4090 em tensor-split) em um chassi de rack, pensado para funcionar 24/7 e atender vários usuários via Open WebUI. Pode ser comprado ou alugado de um provedor de hospedagem francês, se você não quiser gerenciar o hardware.
- 03Mini-PC com memória unificada — 700 a 6.000 €Um Mac mini M4 (a partir de ~700 €) para um servidor de inferência silencioso e de baixo consumo, ou um Mac Studio M5 Ultra (96 GB ou mais, 512 GB anunciados para o final de outubro de 2026) para rodar modelos de 70B–123B sem múltiplas GPUs. Consumo elétrico desprezível em comparação com uma GPU NVIDIA.
#Custos ocultos para não esquecer
O preço de compra é apenas a parte visível. Três categorias de despesas recorrentes são sistematicamente subestimadas no orçamento de um servidor GPU para LLM.
- Eletricidade
- Uma RTX 4090 consome até 450 W em carga. Em inferência quase contínua, isso representa dezenas de euros por mês, dependendo do preço do kWh. Um Mac com memória unificada consome uma fração disso — um verdadeiro argumento para uso 24/7.
- Manutenção e disponibilidade
- Um servidor que precisa responder continuamente exige supervisão, atualizações e gerenciamento de falhas. É tempo humano, invisível na fatura mas real.
- Obsolescência
- Uma GPU perde valor e os modelos evoluem rápido. Amortizar o investimento em 3 anos é razoável, mas, como um modelo 14B de 2026 supera um 70B de 2024, a corrida por hardware nem sempre é necessária — às vezes um modelo mais recente e menor é suficiente.
- Resfriamento e ruído
- Uma GPU de ponta esquenta e faz barulho. Em instalações locais profissionais, prever a ventilação do espaço; em uma estação de trabalho, o conforto acústico conta.
#Para se aprofundar
Três guias relacionados para refinar sua decisão: o guia de escolha da GPU detalha os compromissos entre VRAM, orçamento e desempenho, placa por placa; a calculadora de custos calcula com precisão seu ponto de equilíbrio entre auto-hospedagem e API; e o guia de configuração de PC com 32 GB de VRAM lista os componentes concretos de uma máquina capaz de rodar modelos de 32B.
- Escolher sua GPU para IA local
- Guia de compra 2026: RTX 4070 vs 4090 vs Mac M-Max, decisões sobre VRAM e orçamento.
- Calculadora de custo de LLM
- Calcule o limiar de transição entre hospedagem própria e API com base no seu volume de tokens.
- Configuração de PC para IA: orçamento para 32 GB de VRAM
- A escolha de componentes para montar uma máquina capaz de rodar modelos de 32B localmente.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.