RTX 5090 e LLM local: memória, modelos, benchmark
RTX 5090 e LLM local: entender o que 32 GB de VRAM permitem, escolher um modelo identificável e preparar um benchmark reprodutível. Características do fabricante e estimativas são diferenciadas das medições.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Boa relação custo-benefício para IA local: um GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.
Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Orçamento apertado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#O que é verificado e o que não é
A ficha técnica da NVIDIA informa 32 GB de GDDR7 para a RTX 5090, contra 24 GB para a RTX 4090. Essa diferença aumenta a memória disponível; ela não comprova uma taxa de geração nem uma qualidade de resposta. Fonte do fabricante: https://www.nvidia.com/en-us/geforce/graphics-cards/50-series/rtx-5090/
#Pesos, cache de contexto e margem do runtime
O arquivo quantizado, o cache KV e os buffers do runtime precisam caber juntos na memória. Um arquivo de 32 GB não cabe inteiramente em 32 GB de VRAM com um contexto útil. Reduzir o contexto, escolher uma quantização mais compacta ou aceitar um offload para a CPU são compromissos distintos.
Estimativa teórica apenas dos pesos: parâmetros totais × bits por peso / 8, antes de incluir os metadados e a sobrecarga de quantização. Esse cálculo não é uma medida de VRAM utilizada nem uma garantia de carregamento. O número de parâmetros ativos de um modelo MoE nunca substitui o número total para estimar os pesos a serem armazenados.
#Llama 4 Scout: a correção essencial
A identidade oficial é meta-llama/Llama-4-Scout-17B-16E-Instruct: 17 bilhões de parâmetros ativos, 109 bilhões no total e 16 especialistas. A designação antiga "17B-A2B" e a suposta ocupação de 17 GB eram incorretas. Com quatro bits, 109 bilhões de pesos já representam cerca de 54,5 GB decimais antes da sobrecarga adicional de memória. Esse modelo não cabe inteiramente na GPU de uma única RTX 5090 de 32 GB com essa quantização.
Fonte primária: https://huggingface.co/meta-llama/Llama-4-Scout-17B-16E-Instruct. Um offload para a RAM ou o uso de várias placas altera o protocolo e a taxa de geração. Não atribuímos nenhum resultado de velocidade a essa configuração não medida.
#Um primeiro modelo identificável
Para começar, Qwen/Qwen3-8B e Qwen/Qwen3-14B são dois modelos identificáveis publicados pela Qwen. Comece com quantização Q4 e um contexto de 4096 tokens, depois verifique onde o modelo está efetivamente alocado. O 8B deixa mais margem; o 14B é uma alternativa a comparar em suas próprias tarefas. Essa escolha inicial não constitui um ranking de qualidade testado na RTX 5090.
Fontes: https://huggingface.co/Qwen/Qwen3-8B e https://huggingface.co/Qwen/Qwen3-14B; distribuições Ollama: https://ollama.com/library/qwen3:8b e https://ollama.com/library/qwen3:14b. O tag pode evoluir: verifique seu digest e a quantização com ollama show antes de comparar os resultados.
#RTX 5090 e RTX 4090: comparar sem benchmark enganoso
A RTX 4090 não é compatível com NVLink. Duas RTX 4090 não formam automaticamente um pool de 48 GB utilizável como uma única placa. O runtime pode distribuir algumas cargas via PCIe, com custos de comunicação e limitações próprias do modelo. Fonte NVIDIA: https://www.nvidia.com/en-us/geforce/graphics-cards/40-series/rtx-4090/
Comparar apenas a largura de banda não fornece um multiplicador confiável de tokens por segundo. O processamento do prompt, a geração, a quantização, o contexto, os kernels e o offload precisam ser idênticos. Nenhuma vantagem numérica entre 5090/4090/3090 é reivindicada aqui sem medições comparáveis.
#Protocolo reproduzível a ser aplicado
Registrar o modelo exato da GPU e a VRAM via nvidia-smi, CPU, RAM, sistema operacional, driver, versão do runtime, identificador e hash do modelo, quantização, contexto, batch e offload. Manter apenas um usuário e nenhuma outra carga na GPU durante o teste. Realizar um aquecimento documentado seguido de cinco repetições com as mesmas entradas.
Conservar separadamente prompt_eval_count / prompt_eval_duration e eval_count / eval_duration nas respostas JSON do Ollama. As durações estão em nanosegundos. Publicar cada repetição, a mediana e a dispersão, indicando o uso do cache do prompt. Fonte: https://docs.ollama.com/api/generate. Uma taxa de geração não mede toda a latência percebida nem a qualidade.
#Consumo e preços: dados não medidos aqui
A potência anunciada pelo fabricante não é o consumo na tomada. Uma comparação energética exige um wattímetro, o mesmo sistema, a duração e as saídas produzidas. As antigas relações preço/tokens e recomendações de limite de potência com valores numéricos foram retiradas por falta de medições rastreáveis. Compare os preços atuais somente depois de definir sua necessidade de memória.
#Escolher com base na memória realmente necessária
Uma placa de 32 GB pode ser útil quando o modelo quantizado e o contexto ultrapassam o orçamento de uma placa de 24 GB, mas continuam dentro do de 32 GB. Para modelos pequenos, verifique primeiro o resultado no seu hardware atual. Para o Scout, o peso total continua sendo determinante: os parâmetros ativos não tornam esse modelo compatível com 32 GB.
#Continuar para uma instalação gratuita
O configurador fornece uma estimativa de compatibilidade. A ficha do modelo e o guia sobre Ollama permitem então verificar a instalação e a distribuição entre CPU e GPU antes de qualquer compra. Os resultados de hardware publicados na página Benchmarks devem ser lidos levando em conta o protocolo e a máquina exata usados em cada teste.
- Ficha oficial do Llama 4 Scout
- Especificações de RTX 4090 — NVIDIA
- Medições rastreáveis em nossa máquina de teste
- Instalar o Qwen3 8B
- Estimar a compatibilidade de hardware
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.