Qual LLM na RTX 4090 (24 GB) ?
A RTX 4090 (outubro de 2022) continua sendo, em 2026, a referência de IA local para o público em geral: 24 GB de VRAM GDDR6X, 1008 GB/s de largura de banda, 16.384 núcleos CUDA Ada Lovelace. Ela executa Qwen 3.5 9B a mais de 90 tok/s, um Qwen 3.8 27B Q4 confortavelmente e até um Llama 70B Q4 com offload leve. Agora custando entre 1700 e 2000 € no mercado de usados (estoques ex-LHR), ela oferece uma relação desempenho/€ melhor que a de uma 5080 nova para uso exclusivo de LLM. Este guia detalha todos os modelos que rodam e apresenta ordens de grandeza das taxas de geração de tokens.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Opção de compra para este guia: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.
Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#A RTX 4090 em 2026, ainda rainha
- Arquitetura
- Ada Lovelace (AD102), processo de fabricação TSMC 4N. 76 bilhões de transistores.
- VRAM
- 24 GB de GDDR6X a 21 Gbps, barramento de 384 bits. Largura de banda de 1008 GB/s.
- Núcleos CUDA
- 16 384. Tensor Cores de 4ª geração com suporte nativo a FP8. RT Cores de 3ª geração.
- TDP
- 450 W. Fonte de alimentação de 850 W recomendada.
- Preço de 2026
- 1700 a 2000 € por uma unidade usada em bom estado.
#1. Modelos compatíveis com 24 GB
| Modelo | Quant | VRAM | Tokens/sec | Uso |
|---|---|---|---|---|
| gpt-oss 20B | Q4_K_M | 13 GB | 117-143 | Chat instantâneo |
| Devstral Small 2 24B | Q4_K_M | 14 GB | 36-44 | Chat + RAG FR |
| Qwen 3.6 27B | Q4_K_M | 16 GB | 29-35 | Assistente de código profissional |
| Qwen 3.8 27B | Q4_K_M | 16 GB | 20-24 | Raciocínio de alta qualidade |
| Mistral Small 24B | Q6_K | 20 GB | 32-38 | Ponto ideal versátil |
| GLM 4.7 Flash | Q4_K_M | 19 GB | 90-110 | Raciocínio avançado |
| Granite 4.1 30B Instruct | Q4_K_M | 17 GB | 27-33 | Código complexo em múltiplos arquivos |
| Gemma 4 26B-A4B MoE | Q5_K_M | 19 GB | 54-66 | Offload de 2 GB para a RAM, utilizável |
| Gemma 4 31B | Q5_K_M | 22 GB | 27-33 | Tudo em VRAM, qualidade degradada |
#2. Instalação & CUDA
- 01Drivers NVIDIA 550+CUDA 12.4+. Para uma 4090 nova, o GeForce Experience faz o trabalho. Linux: nvidia-driver-565 ou superior.
- 02OllamaInstalador padrão do ollama.com. Detecção automática da GPU CUDA.
- 03Primeiro teste de modelo com 24 GBollama run qwen3.8:27b — profite de la VRAM dispo et met en valeur la carte.
#3. Benchmarks de tokens por segundo
| Modelo | Q4_K_M | Q5_K_M | Q6_K | Q8_0 |
|---|---|---|---|---|
| Qwen 3.5 4B | 135 t/s | 122 t/s | 110 t/s | 90 t/s |
| Granite 4.2 8B | 100 t/s | 92 t/s | 82 t/s | 66 t/s |
| Qwen 3.5 9B | 92 t/s | 85 t/s | 76 t/s | 62 t/s |
| Gemma 4 12B | 70 t/s | 64 t/s | 57 t/s | 48 t/s |
| Mistral Small 24B | 42 t/s | 38 t/s | 34 t/s | 28 t/s |
| Qwen 3.8 27B | 32 t/s | 28 t/s | 25 t/s | — |
#4. Otimizações Ada
- Flash Attention 2
- Ativo por padrão. FA3 chegará nas versões futuras do llama.cpp
- KV cache Q8
- OLLAMA_KV_CACHE_TYPE=q8_0. Permite contexto de 32k em modelos de 14B em ~15 GB, deixando 9 GB para outros processos.
- Limite de potência
- nvidia-smi -pl 350 (a partir de 350 W). LLM : -2 % de velocidade, -25 % de calor e ruído. Configuração sustentável 24/7.
- FP8 via TensorRT-LLM
- Ada suporta FP8 nativo. Via TensorRT-LLM, +40% de throughput em lote no Qwen 3.5 9B. Especialmente útil ao servir o modelo a vários usuários.
#5. 4090 vs 5090 vs 3090
| Critério | RTX 5090 | RTX 4090 | RTX 3090 |
|---|---|---|---|
| VRAM | 32 GB GDDR7 | 24 GB GDDR6X | 24 GB GDDR6X |
| Largura de banda | 1792 GB/s | 1008 GB/s | 936 GB/s |
| Qwen 3.5 9B Q4 | 115 t/s | 92 t/s | 66 t/s |
| Llama 70B Q4 | 22-28 t/s | 7-10 t/s | 5-8 t/s |
| Preço de 2026 | ≈ 5 700 € (28/09/2026) | ~1800 € usado | ~750 € usado |
#Oportunidade 2026: compra inteligente?
- Compre uma 4090 usada se
- Orçamento de 1500 a 2000 €, uso intenso de LLM, sem necessidade da última geração. 24 GB de VRAM = argumento forte.
- Prefira uma RTX 5090 se
- Orçamento ≥ 5.700 €, uso regular de 70B, necessidade de FP4 nativo, servidor de equipe. 32 GB mudam a situação.
- Prefira uma RTX 3090 se
- Orçamento ≤ 1000 €, uso exclusivo de LLM, velocidade secundária. Mesma VRAM por metade do preço.
- Prefira uma RTX 5070 Ti se
- Orçamento ~1 400 €, uso máximo de 14B. Novo com garantia, GDDR7, suporte a FP4.
#Perguntas frequentes
A RTX 4090 pode rodar o Llama 3.3 70B localmente?+
Quantos tokens por segundo para o Qwen 3.5 9B na RTX 4090?+
RTX 4090 de segunda mão ou RTX 5080 nova?+
A RTX 4090 esquenta e consome muita energia ao executar LLMs?+
É possível fazer fine-tuning LoRA na RTX 4090?+
A RTX 4090 suporta FP8?+
Qual fonte de alimentação usar para a RTX 4090?+
Os preços mudam rápido: nosso monitoramento registra toda segunda e quinta-feira o menor preço das placas de vídeo para IA local, com o preço por GB de VRAM.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.