Configuração de PC de IA: orçamento de 32 GB VRAM
Com 32 GB de VRAM, carregamos um modelo denso de 32 bilhões de parâmetros em Q4 (cerca de 19 a 20 GB) ou Qwen3-Coder 30B-A3B (19 GB), mas não um modelo de 30 bilhões em Q8 (cerca de 32 GB) nem um 70B em Q4 (cerca de 40 GB). Atingimos 32 GB com uma placa de 32 GB ou 48 GB com duas placas de 24 GB.
Esta página indica quanta VRAM você deve buscar conforme o modelo, compara uma única placa de 32 GB, duas placas de 24 GB e uma placa de 24 GB, dimensiona a fonte de alimentação, a RAM, o armazenamento e o gabinete, e corrige uma ideia equivocada: um modelo de 30B em Q8 não cabe em 32 GB.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Boa relação custo-benefício para IA local: um GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.
Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Orçamento apertado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#O que 32 GB de VRAM realmente permitem
Com 32 GB de VRAM, é possível carregar com folga um modelo denso de 32 bilhões de parâmetros em Q4 (cerca de 19 a 20 GB de pesos), com vários milhares de tokens de contexto, ou um modelo de mistura de especialistas de 30 bilhões, como o Qwen3-Coder 30B-A3B, que a biblioteca Ollama anuncia como tendo 19 GB. Não é possível carregar um modelo de 30 bilhões de parâmetros em Q8: ele pesa cerca de 32 GB, tanto quanto a capacidade total da placa, sem espaço para o contexto nem para a memória reservada pelo driver. Um 70B em Q4, com cerca de 40 GB, também não cabe. É possível alcançar os 32 GB com uma única placa de 32 GB ou com duas placas de 24 GB, duas alternativas com vantagens e desvantagens muito diferentes.
| Modelo | Tamanho do modelo | 24 GB (1 placa) | 32 GB (1 placa) | 48 GB (2 × 24 GB) |
|---|---|---|---|---|
| Qwen3-Coder 30B-A3B em Q4 | ≈ 19 GB | Sim, contexto médio | Sim, contexto longo | Sim |
| Modelo denso de 32B em Q4 | ≈ 19 a 20 GB | No limite, contexto curto | Sim | Sim |
| Modelo denso de 32B em Q8 | ≈ 34 GB | Não | Não | Sim, contexto médio |
| Modelo de 30B em Q8 | ≈ 32 GB | Não | Não, não há margem | Sim |
| 70B em Q4 | ≈ 40 GB | Não | Não | Sim, contexto curto |
O Q8 ocupa aproximadamente um byte por parâmetro: é por isso que um modelo de 30 bilhões não cabe em 32 GB. Como a placa não pode dedicar toda a sua memória ao modelo, é preciso escolher um modelo que ocupe pelo menos 3 a 4 GB a menos que a capacidade da VRAM, para reservar espaço para o cache KV. A calculadora de VRAM do site faz esse cálculo para um modelo e um contexto específicos.
#O GPU: três caminhos para atingir 24 a 48 GB
#Opção A: uma placa de 32 GB
A RTX 5090 possui 32 GB de GDDR7 em uma interface de 512 bits, de acordo com a NVIDIA. Sua potência gráfica total atinge 575 W e a NVIDIA indica 1.000 W para a potência necessária do sistema. Ela é alimentada por quatro cabos PCIe de 8 pinos via adaptador fornecido, ou por um cabo PCIe Gen 5 de 600 W. Uma única GPU evita qualquer configuração com múltiplas placas: é a opção mais simples e a que oferece a melhor velocidade por modelo, pois a memória não é distribuída entre placas.
#Opção B: duas placas de 24 GB
A RTX 3090 oferece 24 GB de GDDR6X; a NVIDIA informa uma potência de 350 W para a placa e uma potência necessária de 750 W para o sistema com uma única placa. Duas placas oferecem 48 GB distribuídos, com 700 W apenas para as placas. No llama.cpp, a opção de distribuição é --split-mode: por padrão, o modo layer divide as camadas entre as GPUs, e --tensor-split define a proporção atribuída a cada placa. O modo tensor é descrito ali como experimental. A distribuição não acelera a geração como faria uma única placa mais rápida: sua principal função é permitir que um modelo maior caiba na memória.
#Via C: uma única placa de 24 GB, orçamento apertado
Uma RTX 3090 ou 4090 usada, com 24 GB, já dá conta de um modelo MoE de 30 bilhões de parâmetros em Q4 e de um modelo denso de 27 a 32 bilhões com contexto curto. É uma opção para um orçamento limitado a alguns milhares de euros: os preços mudam toda semana, então o acompanhamento de /prix-gpu-ia é a única referência confiável. A margem diminui rapidamente com o contexto: o cache KV, que pode ocupar vários gigabytes, consome os 4 a 5 GB restantes.
| Critério | Uma placa de 32 GB | Duas placas de 24 GB | Uma placa de 24 GB |
|---|---|---|---|
| VRAM útil | 32 GB | 48 GB distribuídos | 24 GB |
| Complexidade | Nenhum | Distribuição a configurar, duas placas volumosas | Nenhum |
| Potência das placas | 575 W (RTX 5090) | 2 × 350 W (RTX 3090) | 350 W (RTX 3090) |
| Alimentação | Pelo menos 1 000 W (NVIDIA) | Pelo menos 1 200 W recomendados (cálculo deste guia) | 750 W (NVIDIA) |
| Maior modelo em Q4 | 32B com contexto | 70B com contexto curto | 30B especialistas, 32B curto |
#O contexto: a memória que sobra na VRAM para o cache KV
O peso do modelo não diz tudo: cada token de contexto adiciona uma entrada ao cache KV, armazenada também em VRAM. A ficha do modelo Qwen3-Coder-30B-A3B indica 48 camadas e atenção agrupada com 32 cabeças de consulta para 4 cabeças KV. Essa estrutura reduz o tamanho do cache KV a um oitavo em comparação com um modelo que tivesse tantas cabeças KV quanto cabeças de consulta, o que explica por que um modelo assim suporta contextos muito longos em uma placa de 24 ou 32 GB. Nem todos os modelos são tão econômicos: quanto mais cabeças KV um modelo tem, mais rápido seu cache cresce com o contexto.
A regra prática continua a mesma: parta do peso do modelo, some 3 a 4 GB de margem e veja o que resta para o contexto desejado. Se a margem for insuficiente, quantize o cache KV em vez de reduzir a quantização do modelo: o guia dedicado explica o equilíbrio entre vantagens e desvantagens.
#CPU, RAM e placa-mãe: não desperdiçar o orçamento
Durante a geração na GPU, o processador trabalha pouco: ele carrega os modelos, tokeniza, prepara o contexto e mantém o sistema funcionando. Um processador intermediário é suficiente, e o dinheiro é melhor investido na VRAM. A placa-mãe importa mais: para duas placas de 24 GB, são necessários dois slots PCIe x16 fisicamente espaçados e espaço suficiente para placas espessas (a NVIDIA descreve a RTX 3090 Founders Edition como uma placa que ocupa três slots). O número de linhas PCIe por slot influencia pouco a geração depois que o modelo é carregado.
Quanto à memória do sistema, 32 GB é o mínimo para um PC com uma placa de 32 GB; 64 GB é mais confortável se você mantiver um IDE, um navegador e um contêiner abertos enquanto o modelo estiver rodando, ou se transferir parte da execução do modelo para o processador. Nesse último caso, a velocidade depende da RAM: veja o guia de LLM sem GPU. Uma busca frequente, "LLM 32 GB RAM", geralmente se refere a essa situação: com 32 GB de RAM e sem placa gráfica, modelos com 7 a 14 bilhões de parâmetros em Q4 continuam utilizáveis; um 32B em Q4 (cerca de 19 a 20 GB) cabe, mas gera lentamente.
#Fonte de alimentação: o componente em que você não deve economizar
A NVIDIA indica uma potência de sistema necessária de 1.000 W para uma RTX 5090 e de 750 W para uma RTX 3090. Para duas RTX 3090, o cálculo é simples: 2 × 350 W das placas, mais cerca de 250 W para o processador, a placa-mãe, os discos e as ventoinhas, resulta em cerca de 950 W sob carga, com picos acima desse valor. Uma fonte de alimentação de 1.200 W ou mais oferece uma boa margem; essa é uma recomendação deste guia, não uma especificação da Apple ou da NVIDIA. Verifique também o número de conectores PCIe de 8 pinos: uma RTX 5090 exige quatro por meio do adaptador, ou um cabo PCIe Gen 5 de 600 W.
#Armazenamento: a velocidade de carregamento, não a capacidade
Um modelo de 20 a 40 GB é carregado a cada troca de modelo. Cálculo com hipóteses a adaptar: a 200 MB/s, a velocidade típica de um disco rígido, 40 GB exigem cerca de 200 segundos; a 3,5 GB/s, a velocidade de um SSD NVMe, cerca de 12 segundos. Um SSD NVMe de 2 TB é suficiente para cerca de dez modelos e um índice de RAG; um segundo disco serve para backups. O ganho de um SSD PCIe 5.0 na geração é nulo: ela ocorre na VRAM.
#Gabinete e refrigeração
Uma placa de 575 W gera tanto calor quanto um pequeno aquecedor: o gabinete deve expulsar o ar quente mais rápido do que ele entra, com entrada de ar frontal e ventoinhas na parte traseira e no topo. Duas placas espessas lado a lado se aquecem mutuamente: deixe um slot livre entre elas ou escolha modelos mais finos. O guia sobre o comportamento térmico durante a inferência detalha as temperaturas a monitorar e as curvas das ventoinhas.
- Qual LLM para 32 GB de VRAM
- Qual LLM para 24 GB de VRAM
- Qual LLM na RTX 5090
- Qual LLM para RTX 3090 e 3090 Ti
- LLM multi-GPU com llama.cpp
- Preços de placas de vídeo para IA local
#Validar a configuração antes da compra
- 01Partir do modelo, não da placaEscolha o modelo e a quantização desejados, adicione 3 a 4 GB para o cache KV e o driver: o total dá a VRAM mínima. O calculador de VRAM do site faz esse cálculo.
- 02Escolher a opção de GPUUma placa de 32 GB para simplificar, duas placas de 24 GB se o orçamento for a prioridade e se o gabinete e a placa-mãe permitirem, uma única placa de 24 GB para um orçamento apertado.
- 03Dimensionar a fonte de alimentaçãoUse pelo menos a potência do sistema indicada pela NVIDIA para a placa, e adicione margem para duas placas. Conte os conectores PCIe.
- 04Verificar o gabineteComprimento, espessura e circulação de ar para cada placa. Duas placas espessas exigem um gabinete largo e uma placa-mãe com slots espaçados.
- 05Após a montagem, verificar a cargaO comando nvidia-smi exibe a VRAM utilizada e a potência de cada placa; o comando ollama ps mostra se o modelo está rodando totalmente na GPU.
- Fonte: NVIDIA, ficha da GeForce RTX 5090
- Fonte: NVIDIA, ficha da GeForce RTX 3090 e 3090 Ti
- Fonte: ficha do Hugging Face do Qwen3-Coder-30B-A3B
- Fonte: biblioteca Ollama, Qwen3-Coder
#Perguntas frequentes
32 GB de VRAM são suficientes para um modelo com 32 bilhões de parâmetros?+
RTX 5090 ou duas RTX 3090 para 32 GB de VRAM?+
Qual configuração para rodar o Qwen3-Coder 30B-A3B?+
32 GB de RAM são suficientes para um LLM sem placa de vídeo?+
Qual fonte de alimentação escolher para uma RTX 5090?+
Onde encontrar os preços atuais das placas gráficas para IA?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.