Calculadora de custo de LLM — API vs auto-hospedagem
Quanto ChatGPT, Claude, Gemini ou DeepSeek realmente custam para você por mês? A partir de qual volume uma RTX 5090 ou um Mac mini M5 Pro se torna rentável? Digite seu consumo e nós contamos para você.
Seu consumo mensal
Modos avançados
Ative as otimizações que se aplicam ao seu uso. Nem todos os modelos oferecem suporte a todos os modos — consulte as notas na tabela.
Custo mensal via API (8 fournisseurs)
| Modelo | Vendor | Input | Output | Total/mois | Notas |
|---|---|---|---|---|---|
| Mistral Small 4★ mais barato | Mistral | $1.5 | $1.5 | 2.6 € | Hospedado na UE, preço baixo |
| DeepSeek V4.1 Flash | DeepSeek | $3.0 | $3.0 | 5.3 € | -50% fora dos horários de pico |
| GPT-5 mini | OpenAI | $2.5 | $5.0 | 6.6 € | Modelo pequeno, boa relação qualidade/preço |
| Gemini 3.8 Flash | $7.5 | $9.4 | 14.8 € | Flash mais recente (preço garantido até 31/12/2026) | |
| Claude Haiku 4.5 | Anthropic | $10.0 | $12.5 | 19.8 € | Muito rápido, multimodal |
| Claude Sonnet 5 | Anthropic | $20.0 | $25.0 | 39.6 € | Contexto de 1M, melhor relação qualidade/custo da Anthropic |
| Claude Opus 5.5 | Anthropic | $40.0 | $50.0 | 79.2 € | Contexto de 1M, cache a 5% do preço |
| GPT-6 Astra | OpenAI | $100 | $125 | 198 € | Topo de linha da OpenAI (set. 2026) |
Custo mensal de auto-hospedagem (4 configs)
| Hardware | VRAM | Compra TTC | Amort./mois | Eletricidade/mês | Total/mois | Capacidade de tokens/mês | Modelos compatíveis |
|---|---|---|---|---|---|---|---|
| RTX 5070 Ti 16 GB (em um PC existente)★ mais barato | 16 GB | 1 300 € | 54.2 € | 21.1 € | 75.3 € | 19.4M ~45 tok/s | 14B com folga, 24B em Q4 no limite |
| Mac mini M5 Pro 24 GB⚠ subdimensionado | 24 GB | 1 999 € | 83.3 € | 2.8 € | 86.1 € | 8.6M ~20 tok/s | até 14B (≈ 16 GB utilizáveis de 24) |
| Mac Studio M5 Max 36 GB | 36 GB | 2 999 € | 125 € | 4.1 € | 129 € | 15.1M ~35 tok/s | até modelos de ~32B em Q4 (≈ 27 GB utilizáveis) |
| RTX 5090 32 GB (em um PC existente) | 32 GB | 5 000 € | 208 € | 31.2 € | 240 € | 34.6M ~80 tok/s | até 32B em Q4-Q6 (não 70B) |
Veredito
Você está pensando nisso para substituir o GitHub Copilot ou o Cursor? Localmente, é 0 €/mês e seu código nunca vai para a nuvem. O guia « Copiloto de código local » fornece a você a configuração completa (Ollama + Cline + Aider, configurações prontas) para começar em 30 minutos — e diz com franqueza onde o local não substitui a nuvem.
Ver o kit →Local ou assinatura ChatGPT / Claude?
Compare o custo das suas assinaturas com o de uma máquina local compartilhada pela equipe.
Assinaturas: preços públicos consultados em 28/09/2026 (sem impostos, convertidos a 0,88 € por 1 $ e com IVA de 20% acrescentado). Máquina: preço de compra amortizado em 24 meses + eletricidade a 0,20 €/kWh. Um modelo local de 14B a 32B não substitui os modelos mais poderosos nas tarefas difíceis, nem a pesquisa na web ou a geração de imagens incluídas nas assinaturas. Acima de alguns usuários simultâneos, uma placa mais potente se torna necessária.
Quanto custa um servidor GPU para executar um LLM?
Duas formas de ter 'seu' servidor GPU: comprá-lo ou alugá-lo por hora. Para uso de algumas horas por dia, o aluguel costuma ser mais barato no primeiro ano; para uso contínuo, o investimento na compra se paga rapidamente. E uma máquina na sua casa não deixa nenhum dado sair.
Comprar: custo mensal ao longo de 24 meses
| Máquina | Preço | Amortização | Eletricidade (4 h/dia) | Total / mês | Até (Q4) |
|---|---|---|---|---|---|
| RTX 5070 Ti 16 GB (PC existente) | 1 300 € | 54 € | 9 € | ≈ 63 € | 14B |
| Mac mini M5 Pro 24 GB | 1 999 € | 83 € | 2 € | ≈ 85 € | 14B |
| Mac Studio M5 Max 36 GB | 2 999 € | 125 € | 3 € | ≈ 128 € | 32B |
| RTX 5090 32 GB (PC existente) | ≈ 5 000 € | 208 € | 16 € | ≈ 224 € | 32B |
Eletricidade: potência sob carga × 4 h × 30 dias a 0,20 €/kWh, com a máquina desligada no restante do tempo. Preços coletados em setembro de 2026.
Alugar: preço por hora
| Servidor alugado | Memória da GPU | Preço / hora | 4 h por dia | 24 horas por dia |
|---|---|---|---|---|
| Scaleway L4 (Paris) | 24 GB | 0,79 € sem impostos | ≈ 95 € | ≈ 577 € |
| RunPod RTX 5090 | 32 GB | 0,61 à 0,87 € | 73 à 104 € | 443 à 636 € |
| RunPod A100 | 80 GB | 1,05 à 1,40 € | 126 à 168 € | 764 à 1 021 € |
| RunPod H100 | 80 GB | 1,75 à 3,07 € | 210 à 369 € | 1 278 à 2 242 € |
Tarifas públicas verificadas em 28/09/2026 em scaleway.com e runpod.io (RunPod: faixa entre a oferta comunitária e a oferta segura, dólares convertidos a 0,88 €). 4 horas por dia = 120 horas por mês; 24 horas por dia = 730 horas.
Qual escolher?
- Algumas horas por dia: uma RTX 5090 alugada custa 73–104 € por mês, menos do que a amortização de uma placa comprada por aproximadamente 5.000 €.
- Continuamente: uma RTX 5090 alugada 24 horas por dia custa de 443 a 636 € por mês; comprada por ≈ 5 000 €, ela se paga em 9 a 14 meses, incluindo eletricidade (≈ 95 € por mês em uso contínuo).
- Dados sensíveis: uma máquina em sua casa não transmite nada; se você alugar uma, prefira um provedor de hospedagem europeu.
Metodologia e hipóteses
Esta calculadora fornece uma ordem de grandeza, não um orçamento contábil. As hipóteses abaixo são explícitas de propósito para que você possa avaliar o que faz a estimativa se afastar do seu caso real.
Preços da API
- Preços públicos consultados em 28/09/2026 em USD/M tokens, fontes: developers.openai.com/api/docs/pricing, platform.claude.com/docs/en/about-claude/pricing, ai.google.dev/gemini-api/docs/pricing, api-docs.deepseek.com, mistral.ai/pricing.
- Conversão USD→EUR à taxa de 0,88 (setembro de 2026, pode variar ±5% conforme o dia).
- Sobrecusto de contexto longo (OpenAI, Gemini acima de 200k tokens) NÃO aplicado — calc usa um único preço por modelo.
- Cache (preço reduzido específico de cada modelo, de 2% a 10% do preço do input) aplicado somente quando o toggle "Cache prompts" está ativado. Caso contrário, é ignorado.
- Modo lote (50% de desconto em OpenAI/Anthropic/Google/Mistral, atraso de 24h) aplicado apenas se a opção "Modo lote" estiver ativada.
- Tarifa do DeepSeek fora dos horários de pico (-50 %) aplicada apenas se o botão de alternância correspondente estiver ativado.
Preços para hospedagem própria
- Preço de compra = preços com IVA na França, coletados em setembro de 2026 (ativar "IVA recuperável" para exibir os preços sem IVA, -16,67%). As placas gráficas pressupõem um PC já existente.
- Potência em repouso/sob carga = sistema COMPLETO (PC: fonte+CPU+RAM+SSD+GPU; Mac: tudo em um). Fontes: avaliações TomsHardware/AnandTech, Apple Power Analyzer, medições da comunidade pcpartpicker.
- Capacidade de tokens/mês = tok/s estimado × horas ativas × 30 dias. tok/s estimado em uma carga de trabalho mista (modelo que cabe com folga na VRAM + modelo próximo do limite de VRAM).
- NÃO contabilizado: manutenção (~1 h/mês ≈ 30-50 € em valor equivalente ao trabalho de um freelancer), largura de banda da internet, depreciação pura do equipamento revendido, defeitos/RMA.
- Opção "PC ligado 24h" = consumo em repouso (24h - heures_actives) × idleW. Desmarcada = PC desligado fora das horas ativas (0W em repouso).
Limitações importantes
- Qualidade desigual: Llama 3.3 70B local ≠ GPT-5 em raciocínio complexo/multimodal. O ponto de equilíbrio pressupõe equivalência funcional, o que pode superestimar a rentabilidade do self-hosted para alguns casos de uso.
- Disponibilidade: a hospedagem própria exige que a máquina esteja ligada para processar as requisições. API = sempre disponível, escalabilidade instantânea.
- Latência: auto-hospedado = ms (local); API = 200-2000 ms dependendo do fornecedor + região.
- Dados / RGPD: hospedagem própria = nenhum dado enviado a terceiros. API dos EUA (OpenAI/Anthropic/Google) = dados saem do território da UE. Mistral hospedado na UE = conformidade nativa com o RGPD.
- Para ir além: comparador de modelos · configurador de GPU · catálogo com 250 LLMs · Servidor MCP quelllm.