Iniciante 9 minOrçamento

Quanto custa um servidor GPU para LLM? Compra, aluguel, API

O custo de um servidor GPU para LLM não se resume ao preço de uma placa gráfica. Entre comprar uma máquina dedicada, alugar em um provedor de hospedagem ou chamar uma API na nuvem, os perfis de despesa são radicalmente diferentes: investimento inicial alto versus fatura mensal, custo fixo versus custo variável. Este guia apresenta as ordens de grandeza de 2026, o ponto de equilíbrio entre hospedagem própria e API e configurações típicas por orçamento.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-07-13·Testado no Windows, macOS e Linux
Hardware recomendado

Boa relação custo-benefício para IA local: um GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.

Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Orçamento apertado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#As 3 opções e seus perfis de custo

Antes de falar de números, é preciso entender que o custo de um servidor GPU para LLM se divide em três modelos econômicos muito diferentes. A escolha certa não depende apenas do seu orçamento, mas principalmente do volume de uso e da sensibilidade dos seus dados.

Compra (CAPEX)
Você investe uma quantia elevada de uma só vez para ter sua própria máquina. Depois, o custo marginal é quase nulo (eletricidade). Compensa se você usar a máquina com frequência e por muito tempo.
Aluguel (OPEX mensal)
Um servidor GPU dedicado ou uma VM em um provedor, cobrado por mês ou por hora. Sem investimento, mas com fatura recorrente enquanto a máquina estiver rodando.
API na nuvem (OPEX por token)
Você não gerencia nenhuma máquina, paga por uso (por milhão de tokens). Sem custo fixo, mas o preço aumenta linearmente com o uso.
i
A verdadeira pergunta
“Quanto custa um servidor GPU para LLM” não tem uma resposta única. A pergunta útil é: a partir de que volume meu uso justifica comprar em vez de pagar por uso? É um cálculo do ponto de equilíbrio, não um preço de catálogo.

#Comprar uma máquina dedicada

A compra é o modelo clássico de auto-hospedagem: uma máquina em sua casa ou em sua sala técnica, que você amortiza em 2 a 4 anos. O custo se concentra na GPU, que muitas vezes representa mais da metade do orçamento total da máquina.

GPU de entrada — RTX 3060 12 GB
Aproximadamente 300 € de segunda mão. Roda modelos de 7B a 14B em Q4 com conforto. O preço de entrada para um LLM local sério.
GPU multifuncional — RTX 4070 / 4080 16 GB
700 a 1.200 €. Modelos 14B rodam com fluidez, e modelos 32B em Q4 têm um pouco de margem (19 GB de VRAM na 4080… bem no limite).
GPU de alto desempenho — RTX 4090 24 GB
1 600 a 2 000 €. Executa um 32B Q4 (≈19 GB) com bastante folga e um 70B com quantização agressiva. A referência para estações de trabalho.
Memória unificada — Mac Studio / M4 Pro 48–128 GB
De 2.000 a 6.000 €. A VRAM unificada permite carregar modelos de 70B ou até maiores, sem necessidade de várias GPUs. Silencioso e econômico em energia.

A isso se soma o restante da máquina: placa-mãe, CPU, 32 a 64 GB de RAM, fonte robusta (750 W+ para uma 4090) e gabinete ventilado. Conte com 500 a 900 € para uma boa base de PC que acomode a GPU. Uma estação de trabalho completa com GPU capaz de rodar modelos de 32B custa, portanto, entre 2.500 e 3.500 €, com tudo incluído.

→
O mercado de usados derruba os preços
O mercado de GPUs usadas (RTX 3090 24 GB em torno de 700 €, RTX 3060 12 GB em torno de 250 €) muda completamente a equação. Uma RTX 3090 usada oferece 24 GB de VRAM por um terço do preço de uma RTX 4090 usada, em troca de um consumo elétrico mais alto.

#Alugar um servidor com GPU em um provedor

O aluguel evita o investimento inicial e o problema da obsolescência. Duas subcategorias: o servidor com GPU dedicado alugado por mês (você reserva a máquina continuamente) e a GPU por hora no modelo de nuvem (você paga apenas pelas horas de inferência).

GPU dedicada com aluguel mensal — provedor de hospedagem francês
Na OVHcloud ou na Scaleway, o aluguel de um servidor com GPU dedicada custa de algumas centenas a mais de mil euros por mês, dependendo da placa (L4, L40S, H100). Dados hospedados na França: um argumento em termos de soberania e RGPD.
GPU por hora — nuvem spot
Em plataformas como RunPod, Vast.ai e Lambda, é possível alugar uma GPU por 0,20 a 3 €/h, dependendo da placa. Ideal para processamento ocasional em lote ou fine-tuning, não para uso 24/7.
VM com GPU em uma nuvem de uso geral
AWS, GCP e Azure cobram por hora de uso da instância de GPU, muitas vezes mais caro que os provedores especializados, mas oferecem o ecossistema e o SLA de um grande provedor de nuvem.
!
A armadilha de alugar para uso 24/7
Alugar um GPU por hora para um serviço que roda continuamente é o pior dos dois mundos: um GPU de 1,5 €/h deixado ligado continuamente custa mais de 1.000 €/mês, o que equivale ao preço de uma RTX 4090 comprada a cada 6 semanas. A locação por hora só faz sentido para cargas intermitentes.

Regra simples: para uma carga intermitente (algumas horas por dia, processamento em lote, experimentação), o aluguel por hora é mais vantajoso. Para um serviço que precisa responder continuamente, o aluguel mensal de uma GPU dedicada ou a compra passam a ser mais vantajosos já no segundo ou terceiro mês.

#Passar por uma API na nuvem

A API é a opção sem servidor: você não compra nem aluga uma GPU, paga por token consumido. É o ponto de partida mais racional quando o volume é baixo ou imprevisível, pois o custo fixo é nulo.

Modelo de cobrança
Preço por milhão de tokens de entrada e saída. Os tokens de saída geralmente custam mais que os de entrada.
Vantagem
Sem manutenção, sem obsolescência, acesso imediato a modelos de 100B+ impossíveis de rodar em uma estação de trabalho.
Desvantagem de custo
O preço sobe linearmente com o uso. Um pipeline que processa 100.000 documentos por dia transforma uma API “barata” em uma fatura mensal de quatro dígitos.
Desvantagem de privacidade
Seus prompts saem da sua infraestrutura. Isso inviabiliza o uso com dados sensíveis (saúde, área jurídica, código proprietário) sem contrato e uma nuvem dedicada adequada.
i
API auto-hospedada vs API proprietária
Cuidado para não confundir a API de um fornecedor proprietário (dados enviados a terceiros) com uma API compatível com a OpenAI que você mesmo disponibiliza usando Ollama ou vLLM no seu próprio servidor. A segunda oferece a comodidade de uma API sem o custo por token nem o vazamento de dados.

#O ponto de equilíbrio entre hospedagem própria e API

É o cálculo central. Uma GPU comprada é um custo fixo; uma API é um custo variável. Existe, portanto, um volume de tokens a partir do qual ter seu próprio servidor sai mais barato do que pagar por uso. Abaixo desse limite, a API é mais vantajosa; acima, o investimento em hospedagem própria se amortiza.

A ideia: uma RTX 4090 de 1.800 € amortizada em 3 anos equivale a cerca de 50 €/mês de equipamento, mais a energia elétrica. Se o gasto com a API ultrapassar esse valor mensalmente, a compra se torna rentável — muitas vezes a partir de alguns milhões de tokens por dia em uso recorrente. Para uso ocasional de algumas requisições por dia, a API continua imbatível.

→
Use a calculadora
Em vez de fazer uma estimativa grosseira, a calculadora de custos de LLM do site determina com precisão seu ponto de equilíbrio: insira seu volume de tokens, o preço da API que você pretende usar e o custo do hardware; ela indica a partir de quando a hospedagem própria passa a ser financeiramente vantajosa.
Baixo volume, dados não sensíveis
API. O custo fixo de um servidor não se justifica para alguns milhares de tokens por dia.
Volume elevado e recorrente
Compra. O investimento na GPU se paga em alguns meses e o custo marginal por requisição cai para quase zero.
Dados sensíveis, independentemente do volume
Hospedagem própria (compra ou locação na França). A confidencialidade determina a escolha antes mesmo do cálculo do custo.
Pico pontual ou fine-tuning
Aluguel por hora. Paga-se pela capacidade de processamento apenas durante a operação.

#Configuração típica por orçamento

Aqui estão três perfis de máquinas auto-hospedadas correspondentes a três níveis de orçamento e de ambição. As faixas de preço são estimativas para 2026, com todo o hardware incluído.

  1. 01
    Estação de trabalho com GPU — entre 2.500 e 3.500 €
    Uma RTX 4090 de 24 GB (ou uma RTX 3090 de segunda mão para dividir o preço por dois) em um PC com 64 GB de RAM. Executa com conforto um 32B Q4 (≈19 GB de VRAM) e um 70B com quantização agressiva. A referência para um desenvolvedor ou pequena equipe.
  2. 02
    Servidor dedicado de GPU — de 4.000 a 8.000 € ou aluguel mensal
    Uma placa profissional (L40S 48 GB, ou 2× RTX 4090 em tensor-split) em um chassi de rack, pensado para funcionar 24/7 e atender vários usuários via Open WebUI. Pode ser comprado ou alugado de um provedor de hospedagem francês, se você não quiser gerenciar o hardware.
  3. 03
    Mini-PC com memória unificada — 700 a 6.000 €
    Um Mac mini M4 (a partir de ~700 €) para um servidor de inferência silencioso e de baixo consumo, ou um Mac Studio M5 Ultra (96 GB ou mais, 512 GB anunciados para o final de outubro de 2026) para rodar modelos de 70B–123B sem múltiplas GPUs. Consumo elétrico desprezível em comparação com uma GPU NVIDIA.
i
VRAM e tamanho do modelo
Referência de memória em Q4: um 7B cabe em ~5 GB, um 14B em ~9 GB, um 32B em ~19 GB, um 70B em ~40 GB. É a VRAM (ou a memória unificada no Mac) que limita o tamanho do modelo, não a potência de cálculo bruta. Escolha a GPU sobretudo pela quantidade de VRAM.

#Custos ocultos para não esquecer

O preço de compra é apenas a parte visível. Três categorias de despesas recorrentes são sistematicamente subestimadas no orçamento de um servidor GPU para LLM.

Eletricidade
Uma RTX 4090 consome até 450 W em carga. Em inferência quase contínua, isso representa dezenas de euros por mês, dependendo do preço do kWh. Um Mac com memória unificada consome uma fração disso — um verdadeiro argumento para uso 24/7.
Manutenção e disponibilidade
Um servidor que precisa responder continuamente exige supervisão, atualizações e gerenciamento de falhas. É tempo humano, invisível na fatura mas real.
Obsolescência
Uma GPU perde valor e os modelos evoluem rápido. Amortizar o investimento em 3 anos é razoável, mas, como um modelo 14B de 2026 supera um 70B de 2024, a corrida por hardware nem sempre é necessária — às vezes um modelo mais recente e menor é suficiente.
Resfriamento e ruído
Uma GPU de ponta esquenta e faz barulho. Em instalações locais profissionais, prever a ventilação do espaço; em uma estação de trabalho, o conforto acústico conta.
!
Custo total de propriedade
Compare sempre pelo custo total de propriedade (TCO) ao longo do período de amortização, não pelo preço de compra. Uma GPU NVIDIA mais barata na compra, mas que consome muita eletricidade, pode, ao longo de 3 anos de operação 24 horas por dia, 7 dias por semana, custar mais do que um Mac mais caro, mas econômico. Inclua a eletricidade e a manutenção no cálculo.

#Para se aprofundar

Três guias relacionados para refinar sua decisão: o guia de escolha da GPU detalha os compromissos entre VRAM, orçamento e desempenho, placa por placa; a calculadora de custos calcula com precisão seu ponto de equilíbrio entre auto-hospedagem e API; e o guia de configuração de PC com 32 GB de VRAM lista os componentes concretos de uma máquina capaz de rodar modelos de 32B.

Escolher sua GPU para IA local
Guia de compra 2026: RTX 4070 vs 4090 vs Mac M-Max, decisões sobre VRAM e orçamento.
Calculadora de custo de LLM
Calcule o limiar de transição entre hospedagem própria e API com base no seu volume de tokens.
Configuração de PC para IA: orçamento para 32 GB de VRAM
A escolha de componentes para montar uma máquina capaz de rodar modelos de 32B localmente.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.