Guia de orçamento · atualizado em 2026
Construir seu stack LLM local por orçamento
O combo de hardware + modelo mais barato que realmente roda Qwen 3, Gemma 3 e as distilações DeepSeek R1 a uma velocidade adequada para uso em 2026.
Qual máquina para o meu orçamento?
Insira seu orçamento e sua prioridade: a ferramenta apresenta as máquinas que cabem no orçamento, o que elas executam e seus preços verificados esta semana.
Como ler este guia
Defina duas variáveis: orçamento e uso principal. Todo o resto — quantização, ambiente de execução, tamanho do contexto — decorre disso. Comece pela VRAM, escolha o maior modelo que caiba em Q4_K_M com folga para um contexto de 8K e depois escolha o ambiente de execução.
Regra básica: um modelo em GGUF Q4_K_M ocupa aproximadamente (paramètres × 0,6) Go de VRAM, mais cerca de 1,5 GB de cache KV a 8K. Um modelo de 14B precisa, portanto, de cerca de 10 GB, o que explica por que a RTX 3060 de 12 GB usada continua sendo uma referência em custo-benefício.
Escolha seu nível
| Nível | Orçamento | Configuração de referência | VRAM / memória unificada | Modelo ideal (Q4_K_M) |
|---|---|---|---|---|
| Entrada | 400-550 € | Mini-PC Ryzen 7 5700U de segunda mão, 16 GB DDR4 | 0 GB GPU / 16 GB RAM | Qwen3 4B |
| Custo-benefício | 850-1 000 € | Ryzen 5 7600 + RTX 3060 12 GB de segunda mão + 32 GB DDR5 | 12 GB | Qwen 3 14B ou Qwen 2.5 Coder 14B |
| Desempenho | 1 400-1 600 € | Ryzen 7 7700 + RTX 3090 24 GB de segunda mão + 64 GB DDR5 | 24 GB | Qwen3-Coder 30B-A3B ou DeepSeek-R1-Distill-Qwen-32B |
| Silencioso | ≈ 2 000 € | Apple Mac mini M5 Pro 24 GB (novo) | ≈ 16 GB utilizáveis | Qwen 3 14B |
Preços indicativos do mercado de usados na França/UE em meados de 2026 — o mercado de usados varia, verifique os preços atuais antes de comprar.
Nível 2 — o campeão a 900 €
É o nível que recomendamos para a maioria dos leitores. Uma RTX 3060 de 12 GB usada é negociada por cerca de 200 a 240 € no mercado de segunda mão, e 12 GB de VRAM correspondem exatamente ao ponto ideal para modelos da classe 14B.
| Modelo (Q4_K_M) | VRAM utilizada | Tokens/s (estimativa) | Ideal para |
|---|---|---|---|
| Qwen 3 8B | ~6 GB | ~50 | Chat, RAG |
| Qwen 2.5 Coder 14B | ~10 GB | ~28 | Completação de código, refatorações |
| Gemma 3 12B | ~8 GB | ~34 | Multilíngue, perguntas e respostas sobre documentos |
| DeepSeek-R1-Distill-Qwen-14B | ~10 GB | ~28 | Raciocínio passo a passo |
Estimativa, não uma medição feita pelo QuelLLM: cerca de 70% do limite teórico (largura de banda da RTX 3060, 360 GB/s, dividida pelo tamanho do modelo). O limite de um 8B em Q4 é de cerca de 72 tokens/s; o de um 14B, de cerca de 40.
Ambiente de execução: Ollama, llama.cpp ou vLLM?
- Ollama — o melhor para uso individual em computador. Baixa automaticamente os GGUF, oferece API compatível com OpenAI, integra-se a Open WebUI com apenas um comando.
- llama.cpp — o melhor quando se precisa extrair cada token/s de um CPU ou de memória unificada. CLI mais técnica, melhor portabilidade.
- vLLM — o melhor para servir vários usuários ou agentes em paralelo, graças a PagedAttention e ao batching contínuo.
Desenvolvedores individuais → Ollama por padrão. Equipes com 3+ membros → vLLM por trás de um pequeno proxy FastAPI.
Consumo, ruído e custo total
| Config | Em repouso (W) | Consumo (W) | kWh/ano (4 h/dia sob carga) | Custo/ano a 0,20 €/kWh |
|---|---|---|---|---|
| Mini-PC de entrada | 8 | 35 | 51 | 10,20 € |
| 3060 valor | 45 | 220 | 321 | 64,20 € |
| Desempenho com 3090 | 50 | 360 | 526 | 105,10 € |
| Mac mini (processador Pro) | 6 | 65 | 95 | 19,00 € |
Potências em ordem de grandeza. Cálculo: potência sob carga × 4 h × 365 dias, máquina desligada o resto do tempo. Ligada em repouso, some a potência em repouso × 20 h × 365.
Mesmo a configuração que mais consome energia gera um gasto de cerca de 105 € em eletricidade por ano nesse ritmo, o equivalente a pouco mais de cinco meses de uma assinatura de 20 €/mês.
Veredito
| Perfil | Nível recomendado | Por quê |
|---|---|---|
| Curioso, só o chat | Nível de entrada: 400 € | Qwen3 4B na CPU gera texto mais rápido do que se lê |
| Desenvolvedor solo, programação diária | Valor de 900 € | Um modelo de 14B para programação a ~28 tok/s é o ponto de equilíbrio entre preço e desempenho |
| Raciocínio, agentes, múltiplos modelos | Desempenho a 1.500 € | 24 GB permitem usar modelos da classe 32B |
| Silêncio e zero manutenção | Silencioso ≈ 2 000 € | O Mac mini consome apenas alguns watts em repouso |
Perguntas frequentes
8 GB de VRAM são suficientes para um uso útil em 2026?
Marginalmente. Você pode rodar Qwen3 8B Q4_K_M com contexto 4K em uma RTX 3050 8 GB ou uma RX 6600, mas perde a margem para os modelos 14B que tornam a inferência local realmente interessante. Buscar 12 GB, se possível.
Vale a pena comprar uma placa AMD em vez de uma NVIDIA?
Para inferência apenas, as Radeon RDNA3 e RDNA4 (7800 XT, 7900 GRE, RX 9070 XT) funcionam bem com o backend Vulkan do llama.cpp e com ROCm. Elas geralmente custam menos com a mesma memória, mas você perde parte do ecossistema CUDA: vLLM com menos recursos, flash-attn e a maioria das ferramentas de fine-tuning.
É possível fazer fine-tuning com esses orçamentos?
O fine-tuning LoRA de modelos 7B funciona em uma placa de 12 GB com Unsloth. Na prática, um 14B+ exige 24 GB. O fine-tuning completo acima de 1B ultrapassa o que o hardware de consumo permite em 2026.
Como a memória unificada do Mac se compara à VRAM dedicada?
Sua largura de banda permanece bem inferior à de uma placa de alto desempenho: 307 GB/s em um Mac mini M5 Pro contra 936 GB/s em uma RTX 3090. Em um modelo que cabe na placa, o Mac gera, portanto, cerca de 2 a 3 vezes menos tokens por segundo. Ele ganha em consumo, capacidade de memória e carregamento de vários modelos; perde em tokens por segundo por euro.