Ferramenta 02 · Custo de LLM

Calculadora de custo de LLM — API vs auto-hospedagem

Quanto ChatGPT, Claude, Gemini ou DeepSeek realmente custam para você por mês? A partir de qual volume uma RTX 5090 ou um Mac mini M5 Pro se torna rentável? Digite seu consumo e nós contamos para você.

Seu consumo mensal

Referência: 10M de entrada + 2,5M de saída = ~5.000 conversas de duração média com o Claude (1.500 tokens de entrada + 500 de saída por conversa). Ajuste conforme seu uso.

Modos avançados

Ative as otimizações que se aplicam ao seu uso. Nem todos os modelos oferecem suporte a todos os modos — consulte as notas na tabela.

Custo mensal via API (8 fournisseurs)

Clique nos selos para ativar/desativar os modelos.
ModeloVendorInputOutputTotal/moisNotas
Mistral Small 4★ mais baratoMistral$1.5$1.52.6 €Hospedado na UE, preço baixo
DeepSeek V4.1 FlashDeepSeek$3.0$3.05.3 €-50% fora dos horários de pico
GPT-5 miniOpenAI$2.5$5.06.6 €Modelo pequeno, boa relação qualidade/preço
Gemini 3.8 FlashGoogle$7.5$9.414.8 €Flash mais recente (preço garantido até 31/12/2026)
Claude Haiku 4.5Anthropic$10.0$12.519.8 €Muito rápido, multimodal
Claude Sonnet 5Anthropic$20.0$25.039.6 €Contexto de 1M, melhor relação qualidade/custo da Anthropic
Claude Opus 5.5Anthropic$40.0$50.079.2 €Contexto de 1M, cache a 5% do preço
GPT-6 AstraOpenAI$100$125198 €Topo de linha da OpenAI (set. 2026)

Custo mensal de auto-hospedagem (4 configs)

Hardware amortizado em 24 mês + eletricidade (0.20 €/kWh). Capacity = tok/s estimado × 4h/dia × 30 dias; aviso se insuficiente para 12.5M tokens solicitados.
HardwareVRAMCompra TTCAmort./moisEletricidade/mêsTotal/moisCapacidade de tokens/mêsModelos compatíveis
RTX 5070 Ti 16 GB (em um PC existente)★ mais barato16 GB1 300 €54.2 €21.1 €75.3 €19.4M
~45 tok/s
14B com folga, 24B em Q4 no limite
Mac mini M5 Pro 24 GB⚠ subdimensionado24 GB1 999 €83.3 €2.8 €86.1 €8.6M
~20 tok/s
até 14B (≈ 16 GB utilizáveis de 24)
Mac Studio M5 Max 36 GB36 GB2 999 €125 €4.1 €129 €15.1M
~35 tok/s
até modelos de ~32B em Q4 (≈ 27 GB utilizáveis)
RTX 5090 32 GB (em um PC existente)32 GB5 000 €208 €31.2 €240 €34.6M
~80 tok/s
até 32B em Q4-Q6 (não 70B)

Veredito

Comparação personalizável — altere as opções abaixo.
APIs para comparar
Mistral Small 4
2.6 €/mois
API mais barata ★. Nenhum hardware para comprar, escalabilidade instantânea.
Hardware a comparar
RTX 5070 Ti 16 GB (em um PC existente)
75.3 €/mois (amorti)
Tokens locais, dados privados, latência em ms.
Ponto de equilíbrio da auto-hospedagem
Nunca (nesse volume)
No seu volume atual, Mistral Small 4 (2.6 €/mês) custa menos que apenas a eletricidade consumida por RTX 5070 Ti 16 GB (em um PC existente). Aumente o consumo ou mude o hardware/API acima.
Se for para programar
O mesmo cálculo, na versão Copilot

Você está pensando nisso para substituir o GitHub Copilot ou o Cursor? Localmente, é 0 €/mês e seu código nunca vai para a nuvem. O guia « Copiloto de código local » fornece a você a configuração completa (Ollama + Cline + Aider, configurações prontas) para começar em 30 minutos — e diz com franqueza onde o local não substitui a nuvem.

Ver o kit →

Local ou assinatura ChatGPT / Claude?

Compare o custo das suas assinaturas com o de uma máquina local compartilhada pela equipe.

Assinaturas
63.4 €
por mês, com impostos incluídos
Máquina local
85.1 €
por mês durante 24 meses
Reembolsada em
32,5 meses
economia em 3 anos: 217 €

Assinaturas: preços públicos consultados em 28/09/2026 (sem impostos, convertidos a 0,88 € por 1 $ e com IVA de 20% acrescentado). Máquina: preço de compra amortizado em 24 meses + eletricidade a 0,20 €/kWh. Um modelo local de 14B a 32B não substitui os modelos mais poderosos nas tarefas difíceis, nem a pesquisa na web ou a geração de imagens incluídas nas assinaturas. Acima de alguns usuários simultâneos, uma placa mais potente se torna necessária.

Quanto custa um servidor GPU para executar um LLM?

Duas formas de ter 'seu' servidor GPU: comprá-lo ou alugá-lo por hora. Para uso de algumas horas por dia, o aluguel costuma ser mais barato no primeiro ano; para uso contínuo, o investimento na compra se paga rapidamente. E uma máquina na sua casa não deixa nenhum dado sair.

Comprar: custo mensal ao longo de 24 meses

MáquinaPreçoAmortizaçãoEletricidade (4 h/dia)Total / mêsAté (Q4)
RTX 5070 Ti 16 GB (PC existente)1 300 €54 €9 €≈ 63 €14B
Mac mini M5 Pro 24 GB1 999 €83 €2 €≈ 85 €14B
Mac Studio M5 Max 36 GB2 999 €125 €3 €≈ 128 €32B
RTX 5090 32 GB (PC existente)≈ 5 000 €208 €16 €≈ 224 €32B

Eletricidade: potência sob carga × 4 h × 30 dias a 0,20 €/kWh, com a máquina desligada no restante do tempo. Preços coletados em setembro de 2026.

Alugar: preço por hora

Servidor alugadoMemória da GPUPreço / hora4 h por dia24 horas por dia
Scaleway L4 (Paris)24 GB0,79 € sem impostos≈ 95 €≈ 577 €
RunPod RTX 509032 GB0,61 à 0,87 €73 à 104 €443 à 636 €
RunPod A10080 GB1,05 à 1,40 €126 à 168 €764 à 1 021 €
RunPod H10080 GB1,75 à 3,07 €210 à 369 €1 278 à 2 242 €

Tarifas públicas verificadas em 28/09/2026 em scaleway.com e runpod.io (RunPod: faixa entre a oferta comunitária e a oferta segura, dólares convertidos a 0,88 €). 4 horas por dia = 120 horas por mês; 24 horas por dia = 730 horas.

Qual escolher?

  • Algumas horas por dia: uma RTX 5090 alugada custa 73–104 € por mês, menos do que a amortização de uma placa comprada por aproximadamente 5.000 €.
  • Continuamente: uma RTX 5090 alugada 24 horas por dia custa de 443 a 636 € por mês; comprada por ≈ 5 000 €, ela se paga em 9 a 14 meses, incluindo eletricidade (≈ 95 € por mês em uso contínuo).
  • Dados sensíveis: uma máquina em sua casa não transmite nada; se você alugar uma, prefira um provedor de hospedagem europeu.

Metodologia e hipóteses

Esta calculadora fornece uma ordem de grandeza, não um orçamento contábil. As hipóteses abaixo são explícitas de propósito para que você possa avaliar o que faz a estimativa se afastar do seu caso real.

Preços da API

  • Preços públicos consultados em 28/09/2026 em USD/M tokens, fontes: developers.openai.com/api/docs/pricing, platform.claude.com/docs/en/about-claude/pricing, ai.google.dev/gemini-api/docs/pricing, api-docs.deepseek.com, mistral.ai/pricing.
  • Conversão USD→EUR à taxa de 0,88 (setembro de 2026, pode variar ±5% conforme o dia).
  • Sobrecusto de contexto longo (OpenAI, Gemini acima de 200k tokens) NÃO aplicado — calc usa um único preço por modelo.
  • Cache (preço reduzido específico de cada modelo, de 2% a 10% do preço do input) aplicado somente quando o toggle "Cache prompts" está ativado. Caso contrário, é ignorado.
  • Modo lote (50% de desconto em OpenAI/Anthropic/Google/Mistral, atraso de 24h) aplicado apenas se a opção "Modo lote" estiver ativada.
  • Tarifa do DeepSeek fora dos horários de pico (-50 %) aplicada apenas se o botão de alternância correspondente estiver ativado.

Preços para hospedagem própria

  • Preço de compra = preços com IVA na França, coletados em setembro de 2026 (ativar "IVA recuperável" para exibir os preços sem IVA, -16,67%). As placas gráficas pressupõem um PC já existente.
  • Potência em repouso/sob carga = sistema COMPLETO (PC: fonte+CPU+RAM+SSD+GPU; Mac: tudo em um). Fontes: avaliações TomsHardware/AnandTech, Apple Power Analyzer, medições da comunidade pcpartpicker.
  • Capacidade de tokens/mês = tok/s estimado × horas ativas × 30 dias. tok/s estimado em uma carga de trabalho mista (modelo que cabe com folga na VRAM + modelo próximo do limite de VRAM).
  • NÃO contabilizado: manutenção (~1 h/mês ≈ 30-50 € em valor equivalente ao trabalho de um freelancer), largura de banda da internet, depreciação pura do equipamento revendido, defeitos/RMA.
  • Opção "PC ligado 24h" = consumo em repouso (24h - heures_actives) × idleW. Desmarcada = PC desligado fora das horas ativas (0W em repouso).

Limitações importantes

  • Qualidade desigual: Llama 3.3 70B local ≠ GPT-5 em raciocínio complexo/multimodal. O ponto de equilíbrio pressupõe equivalência funcional, o que pode superestimar a rentabilidade do self-hosted para alguns casos de uso.
  • Disponibilidade: a hospedagem própria exige que a máquina esteja ligada para processar as requisições. API = sempre disponível, escalabilidade instantânea.
  • Latência: auto-hospedado = ms (local); API = 200-2000 ms dependendo do fornecedor + região.
  • Dados / RGPD: hospedagem própria = nenhum dado enviado a terceiros. API dos EUA (OpenAI/Anthropic/Google) = dados saem do território da UE. Mistral hospedado na UE = conformidade nativa com o RGPD.
  • Para ir além: comparador de modelos · configurador de GPU · catálogo com 250 LLMs · Servidor MCP quelllm.