Intermediário 12 minRTX 40

Qual LLM na RTX 4090 (24 GB) ?

A RTX 4090 (outubro de 2022) continua sendo, em 2026, a referência de IA local para o público em geral: 24 GB de VRAM GDDR6X, 1008 GB/s de largura de banda, 16.384 núcleos CUDA Ada Lovelace. Ela executa Qwen 3.5 9B a mais de 90 tok/s, um Qwen 3.8 27B Q4 confortavelmente e até um Llama 70B Q4 com offload leve. Agora custando entre 1700 e 2000 € no mercado de usados (estoques ex-LHR), ela oferece uma relação desempenho/€ melhor que a de uma 5080 nova para uso exclusivo de LLM. Este guia detalha todos os modelos que rodam e apresenta ordens de grandeza das taxas de geração de tokens.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-08-27·Testado no Windows, macOS e Linux
Hardware recomendado

Opção de compra para este guia: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.

Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#A RTX 4090 em 2026, ainda rainha

Arquitetura
Ada Lovelace (AD102), processo de fabricação TSMC 4N. 76 bilhões de transistores.
VRAM
24 GB de GDDR6X a 21 Gbps, barramento de 384 bits. Largura de banda de 1008 GB/s.
Núcleos CUDA
16 384. Tensor Cores de 4ª geração com suporte nativo a FP8. RT Cores de 3ª geração.
TDP
450 W. Fonte de alimentação de 850 W recomendada.
Preço de 2026
1700 a 2000 € por uma unidade usada em bom estado.
→
Por que ainda é relevante em 2026
24 GB = patamar mágico que permite rodar Llama 3.3 70B Q2_K (26 GB com offload de 2 GB), Qwen 3.8 27B em Q8 e Qwen3-Coder 30B-A3B. A 5080 (16 GB, nova) não consegue; a 5090 (32 GB, nova, ≈ 5.700 €) custa cerca de 3× o preço. Considerando apenas a relação VRAM/€, a 4090 usada domina.

#1. Modelos compatíveis com 24 GB

Modelos LLM — RTX 4090 24 GB
ModeloQuantVRAMTokens/secUso
gpt-oss 20BQ4_K_M13 GB117-143Chat instantâneo
Devstral Small 2 24BQ4_K_M14 GB36-44Chat + RAG FR
Qwen 3.6 27BQ4_K_M16 GB29-35Assistente de código profissional
Qwen 3.8 27BQ4_K_M16 GB20-24Raciocínio de alta qualidade
Mistral Small 24BQ6_K20 GB32-38Ponto ideal versátil
GLM 4.7 FlashQ4_K_M19 GB90-110Raciocínio avançado
Granite 4.1 30B InstructQ4_K_M17 GB27-33Código complexo em múltiplos arquivos
Gemma 4 26B-A4B MoEQ5_K_M19 GB54-66Offload de 2 GB para a RAM, utilizável
Gemma 4 31BQ5_K_M22 GB27-33Tudo em VRAM, qualidade degradada
i
Llama 70B: qual quantização priorizar?
Q4_K_M (42 GB): exige muito offload, cerca de 6 tok/s, e é pouco confortável. Q2_K (26 GB): 2 GB a transferir para a RAM, cerca de 10 tok/s, com qualidade razoável. IQ2_XS (21 GB): tudo na VRAM, cerca de 20 tok/s, mas com qualidade bem inferior. Para usar um 70B confortavelmente em ambiente local, escolha uma 5090 (32 GB) ou um Mac Studio.

#2. Instalação & CUDA

  1. 01
    Drivers NVIDIA 550+
    CUDA 12.4+. Para uma 4090 nova, o GeForce Experience faz o trabalho. Linux: nvidia-driver-565 ou superior.
  2. 02
    Ollama
    Instalador padrão do ollama.com. Detecção automática da GPU CUDA.
  3. 03
    Primeiro teste de modelo com 24 GB
    ollama run qwen3.8:27b — profite de la VRAM dispo et met en valeur la carte.
Configuração completa no Linux
# Ubuntu 24.04
sudo apt install nvidia-driver-565
sudo reboot

curl -fsSL https://ollama.com/install.sh | sh
ollama run qwen3.8:27b

#3. Benchmarks de tokens por segundo

RTX 4090 24 GB — ordens de grandeza de tokens por segundo
ModeloQ4_K_MQ5_K_MQ6_KQ8_0
Qwen 3.5 4B135 t/s122 t/s110 t/s90 t/s
Granite 4.2 8B100 t/s92 t/s82 t/s66 t/s
Qwen 3.5 9B92 t/s85 t/s76 t/s62 t/s
Gemma 4 12B70 t/s64 t/s57 t/s48 t/s
Mistral Small 24B42 t/s38 t/s34 t/s28 t/s
Qwen 3.8 27B32 t/s28 t/s25 t/s—

#4. Otimizações Ada

Flash Attention 2
Ativo por padrão. FA3 chegará nas versões futuras do llama.cpp
KV cache Q8
OLLAMA_KV_CACHE_TYPE=q8_0. Permite contexto de 32k em modelos de 14B em ~15 GB, deixando 9 GB para outros processos.
Limite de potência
nvidia-smi -pl 350 (a partir de 350 W). LLM : -2 % de velocidade, -25 % de calor e ruído. Configuração sustentável 24/7.
FP8 via TensorRT-LLM
Ada suporta FP8 nativo. Via TensorRT-LLM, +40% de throughput em lote no Qwen 3.5 9B. Especialmente útil ao servir o modelo a vários usuários.

#5. 4090 vs 5090 vs 3090

Os três modelos topo de linha da NVIDIA para o mercado de consumo
CritérioRTX 5090RTX 4090RTX 3090
VRAM32 GB GDDR724 GB GDDR6X24 GB GDDR6X
Largura de banda1792 GB/s1008 GB/s936 GB/s
Qwen 3.5 9B Q4115 t/s92 t/s66 t/s
Llama 70B Q422-28 t/s7-10 t/s5-8 t/s
Preço de 2026≈ 5 700 € (28/09/2026)~1800 € usado~750 € usado
→
A melhor relação 24 GB/€: 3090 usada
Por 750 € versus 1800 €, a 3090 oferece os mesmos 24 GB de VRAM. Perda de aproximadamente 30% na velocidade pura. Se sua prioridade for a VRAM (modelos de 24-32B, QLoRA 14B+) e não a velocidade máxima, a 3090 usada continua sendo a placa com o melhor custo-benefício para LLMs em toda a história da NVIDIA.

#Oportunidade 2026: compra inteligente?

Compre uma 4090 usada se
Orçamento de 1500 a 2000 €, uso intenso de LLM, sem necessidade da última geração. 24 GB de VRAM = argumento forte.
Prefira uma RTX 5090 se
Orçamento ≥ 5.700 €, uso regular de 70B, necessidade de FP4 nativo, servidor de equipe. 32 GB mudam a situação.
Prefira uma RTX 3090 se
Orçamento ≤ 1000 €, uso exclusivo de LLM, velocidade secundária. Mesma VRAM por metade do preço.
Prefira uma RTX 5070 Ti se
Orçamento ~1 400 €, uso máximo de 14B. Novo com garantia, GDDR7, suporte a FP4.

#Perguntas frequentes

A RTX 4090 pode rodar o Llama 3.3 70B localmente?+
Sim, mas com concessões. Q4_K_M (42 GB): offload massivo → 6-8 tok/s (inutilizável). Q2_K (26 GB): 2 GB em RAM → 10-12 tok/s (aceitável). IQ2_XS (21 GB): inteiramente na VRAM → 20 tok/s, mas com qualidade degradada. Para usar um modelo realmente grande com conforto, prefira uma 5090 (32 GB) — ou continue com um Qwen 3.8 27B que cabe inteiro na VRAM.
Quantos tokens por segundo para o Qwen 3.5 9B na RTX 4090?+
Aproximadamente 90 tokens/s em Q4_K_M, 62 tok/s em Q8_0. Mais do que suficiente para qualquer uso de chat, com os 256k de contexto e a capacidade de visão do modelo como bônus.
RTX 4090 de segunda mão ou RTX 5080 nova?+
4090 usada (1800 €): 24 GB de VRAM, 10% mais lenta que uma 5080 em modelos de 7B, mas permite rodar 70B com offload e 32B em Q6. 5080 nova (≈ 1 500 a 1 850 €): 16 GB, mais rápida em modelos pequenos, garantia de 3 anos e suporte a FP4. Para uso exclusivo com LLMs, a 4090 ganha graças à VRAM. Para desempenho e garantia, a 5080.
A RTX 4090 esquenta e consome muita energia ao executar LLMs?+
Menos do que em jogos. Inferência contínua com Qwen 3.5 9B: 250-320 W (vs 450 W de TDP), GPU a 65-72 °C. Um gabinete com bom fluxo de ar é suficiente. Para uso 24/7, fazer undervolt a 350 W reduz o calor e o ruído sem perda significativa de desempenho com LLMs.
É possível fazer fine-tuning LoRA na RTX 4090?+
Sim, excelente. LoRA em Qwen 3.5 9B: 12 GB, confortável com batch 4, contexto 4096. QLoRA em Mistral Small 24B: ~18 GB, possível. QLoRA em um 70B: apertado, mas viável com unsloth + batch 1. Para LoRA clássico em 70B, você precisa de 2× 4090 ou uma 5090.
A RTX 4090 suporta FP8?+
Sim, os Tensor Cores da 4ª geração Ada Lovelace suportam FP8 nativamente. Utilizados pelo TensorRT-LLM (melhoria de +30 a 40% em relação ao FP16), vLLM (0.5+), parcialmente pelo llama.cpp. Para o Ollama de uso geral, continua sendo Q4-Q8. Para servidores em lote, o FP8 vale a pena.
Qual fonte de alimentação usar para a RTX 4090?+
Uma fonte de qualidade de no mínimo 850 W (ATX 3.0 recomendado, mas não obrigatório). No uso de LLMs, consumo médio de 250–320 W. Em jogos ou benchmarks, 450 W. Com uma CPU de alto desempenho (9950X, 14900K), uma fonte de 1000 W oferece mais tranquilidade.

Os preços mudam rápido: nosso monitoramento registra toda segunda e quinta-feira o menor preço das placas de vídeo para IA local, com o preço por GB de VRAM.

Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.