◆ IA Local — Seu ChatGPT privado e gratuito, na sua máquina, em 1 h · 24 € · ou todos os kits por 49 € →

Guia de orçamento · atualizado em 2026

Construir seu stack LLM local por orçamento

O combo de hardware + modelo mais barato que realmente roda Qwen 3, Gemma 3 e as distilações DeepSeek R1 a uma velocidade adequada para uso em 2026.

Qual máquina para o meu orçamento?

Insira seu orçamento e sua prioridade: a ferramenta apresenta as máquinas que cabem no orçamento, o que elas executam e seus preços verificados esta semana.

Como ler este guia

Defina duas variáveis: orçamento e uso principal. Todo o resto — quantização, ambiente de execução, tamanho do contexto — decorre disso. Comece pela VRAM, escolha o maior modelo que caiba em Q4_K_M com folga para um contexto de 8K e depois escolha o ambiente de execução.

Regra básica: um modelo em GGUF Q4_K_M ocupa aproximadamente (paramètres × 0,6) Go de VRAM, mais cerca de 1,5 GB de cache KV a 8K. Um modelo de 14B precisa, portanto, de cerca de 10 GB, o que explica por que a RTX 3060 de 12 GB usada continua sendo uma referência em custo-benefício.

Escolha seu nível

NívelOrçamentoConfiguração de referênciaVRAM / memória unificadaModelo ideal (Q4_K_M)
Entrada400-550 €Mini-PC Ryzen 7 5700U de segunda mão, 16 GB DDR40 GB GPU / 16 GB RAMQwen3 4B
Custo-benefício850-1 000 €Ryzen 5 7600 + RTX 3060 12 GB de segunda mão + 32 GB DDR512 GBQwen 3 14B ou Qwen 2.5 Coder 14B
Desempenho1 400-1 600 €Ryzen 7 7700 + RTX 3090 24 GB de segunda mão + 64 GB DDR524 GBQwen3-Coder 30B-A3B ou DeepSeek-R1-Distill-Qwen-32B
Silencioso≈ 2 000 €Apple Mac mini M5 Pro 24 GB (novo)≈ 16 GB utilizáveisQwen 3 14B

Preços indicativos do mercado de usados na França/UE em meados de 2026 — o mercado de usados varia, verifique os preços atuais antes de comprar.

Nível 2 — o campeão a 900 €

É o nível que recomendamos para a maioria dos leitores. Uma RTX 3060 de 12 GB usada é negociada por cerca de 200 a 240 € no mercado de segunda mão, e 12 GB de VRAM correspondem exatamente ao ponto ideal para modelos da classe 14B.

Modelo (Q4_K_M)VRAM utilizadaTokens/s (estimativa)Ideal para
Qwen 3 8B~6 GB~50Chat, RAG
Qwen 2.5 Coder 14B~10 GB~28Completação de código, refatorações
Gemma 3 12B~8 GB~34Multilíngue, perguntas e respostas sobre documentos
DeepSeek-R1-Distill-Qwen-14B~10 GB~28Raciocínio passo a passo

Estimativa, não uma medição feita pelo QuelLLM: cerca de 70% do limite teórico (largura de banda da RTX 3060, 360 GB/s, dividida pelo tamanho do modelo). O limite de um 8B em Q4 é de cerca de 72 tokens/s; o de um 14B, de cerca de 40.

Ambiente de execução: Ollama, llama.cpp ou vLLM?

Desenvolvedores individuais → Ollama por padrão. Equipes com 3+ membros → vLLM por trás de um pequeno proxy FastAPI.

Consumo, ruído e custo total

ConfigEm repouso (W)Consumo (W)kWh/ano (4 h/dia sob carga)Custo/ano a 0,20 €/kWh
Mini-PC de entrada8355110,20 €
3060 valor4522032164,20 €
Desempenho com 309050360526105,10 €
Mac mini (processador Pro)6659519,00 €

Potências em ordem de grandeza. Cálculo: potência sob carga × 4 h × 365 dias, máquina desligada o resto do tempo. Ligada em repouso, some a potência em repouso × 20 h × 365.

Mesmo a configuração que mais consome energia gera um gasto de cerca de 105 € em eletricidade por ano nesse ritmo, o equivalente a pouco mais de cinco meses de uma assinatura de 20 €/mês.

Veredito

PerfilNível recomendadoPor quê
Curioso, só o chatNível de entrada: 400 €Qwen3 4B na CPU gera texto mais rápido do que se lê
Desenvolvedor solo, programação diáriaValor de 900 €Um modelo de 14B para programação a ~28 tok/s é o ponto de equilíbrio entre preço e desempenho
Raciocínio, agentes, múltiplos modelosDesempenho a 1.500 €24 GB permitem usar modelos da classe 32B
Silêncio e zero manutençãoSilencioso ≈ 2 000 €O Mac mini consome apenas alguns watts em repouso

Perguntas frequentes

8 GB de VRAM são suficientes para um uso útil em 2026?

Marginalmente. Você pode rodar Qwen3 8B Q4_K_M com contexto 4K em uma RTX 3050 8 GB ou uma RX 6600, mas perde a margem para os modelos 14B que tornam a inferência local realmente interessante. Buscar 12 GB, se possível.

Vale a pena comprar uma placa AMD em vez de uma NVIDIA?

Para inferência apenas, as Radeon RDNA3 e RDNA4 (7800 XT, 7900 GRE, RX 9070 XT) funcionam bem com o backend Vulkan do llama.cpp e com ROCm. Elas geralmente custam menos com a mesma memória, mas você perde parte do ecossistema CUDA: vLLM com menos recursos, flash-attn e a maioria das ferramentas de fine-tuning.

É possível fazer fine-tuning com esses orçamentos?

O fine-tuning LoRA de modelos 7B funciona em uma placa de 12 GB com Unsloth. Na prática, um 14B+ exige 24 GB. O fine-tuning completo acima de 1B ultrapassa o que o hardware de consumo permite em 2026.

Como a memória unificada do Mac se compara à VRAM dedicada?

Sua largura de banda permanece bem inferior à de uma placa de alto desempenho: 307 GB/s em um Mac mini M5 Pro contra 936 GB/s em uma RTX 3090. Em um modelo que cabe na placa, o Mac gera, portanto, cerca de 2 a 3 vezes menos tokens por segundo. Ele ganha em consumo, capacidade de memória e carregamento de vários modelos; perde em tokens por segundo por euro.

Mais ferramentas gratuitas