Intermediário 11 minBuild

Configuração de PC de IA: orçamento de 32 GB VRAM

Resposta direta

Com 32 GB de VRAM, carregamos um modelo denso de 32 bilhões de parâmetros em Q4 (cerca de 19 a 20 GB) ou Qwen3-Coder 30B-A3B (19 GB), mas não um modelo de 30 bilhões em Q8 (cerca de 32 GB) nem um 70B em Q4 (cerca de 40 GB). Atingimos 32 GB com uma placa de 32 GB ou 48 GB com duas placas de 24 GB.

Esta página indica quanta VRAM você deve buscar conforme o modelo, compara uma única placa de 32 GB, duas placas de 24 GB e uma placa de 24 GB, dimensiona a fonte de alimentação, a RAM, o armazenamento e o gabinete, e corrige uma ideia equivocada: um modelo de 30B em Q8 não cabe em 32 GB.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-29·Testado no Windows, macOS e Linux
Hardware recomendado

Boa relação custo-benefício para IA local: um GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.

Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Orçamento apertado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#O que 32 GB de VRAM realmente permitem

Com 32 GB de VRAM, é possível carregar com folga um modelo denso de 32 bilhões de parâmetros em Q4 (cerca de 19 a 20 GB de pesos), com vários milhares de tokens de contexto, ou um modelo de mistura de especialistas de 30 bilhões, como o Qwen3-Coder 30B-A3B, que a biblioteca Ollama anuncia como tendo 19 GB. Não é possível carregar um modelo de 30 bilhões de parâmetros em Q8: ele pesa cerca de 32 GB, tanto quanto a capacidade total da placa, sem espaço para o contexto nem para a memória reservada pelo driver. Um 70B em Q4, com cerca de 40 GB, também não cabe. É possível alcançar os 32 GB com uma única placa de 32 GB ou com duas placas de 24 GB, duas alternativas com vantagens e desvantagens muito diferentes.

O que cabe de acordo com a VRAM disponível (apenas os pesos do modelo, segundo as referências do site; o contexto deve ser acrescentado)
ModeloTamanho do modelo24 GB (1 placa)32 GB (1 placa)48 GB (2 × 24 GB)
Qwen3-Coder 30B-A3B em Q4≈ 19 GBSim, contexto médioSim, contexto longoSim
Modelo denso de 32B em Q4≈ 19 a 20 GBNo limite, contexto curtoSimSim
Modelo denso de 32B em Q8≈ 34 GBNãoNãoSim, contexto médio
Modelo de 30B em Q8≈ 32 GBNãoNão, não há margemSim
70B em Q4≈ 40 GBNãoNãoSim, contexto curto

O Q8 ocupa aproximadamente um byte por parâmetro: é por isso que um modelo de 30 bilhões não cabe em 32 GB. Como a placa não pode dedicar toda a sua memória ao modelo, é preciso escolher um modelo que ocupe pelo menos 3 a 4 GB a menos que a capacidade da VRAM, para reservar espaço para o cache KV. A calculadora de VRAM do site faz esse cálculo para um modelo e um contexto específicos.

#O GPU: três caminhos para atingir 24 a 48 GB

#Opção A: uma placa de 32 GB

A RTX 5090 possui 32 GB de GDDR7 em uma interface de 512 bits, de acordo com a NVIDIA. Sua potência gráfica total atinge 575 W e a NVIDIA indica 1.000 W para a potência necessária do sistema. Ela é alimentada por quatro cabos PCIe de 8 pinos via adaptador fornecido, ou por um cabo PCIe Gen 5 de 600 W. Uma única GPU evita qualquer configuração com múltiplas placas: é a opção mais simples e a que oferece a melhor velocidade por modelo, pois a memória não é distribuída entre placas.

#Opção B: duas placas de 24 GB

A RTX 3090 oferece 24 GB de GDDR6X; a NVIDIA informa uma potência de 350 W para a placa e uma potência necessária de 750 W para o sistema com uma única placa. Duas placas oferecem 48 GB distribuídos, com 700 W apenas para as placas. No llama.cpp, a opção de distribuição é --split-mode: por padrão, o modo layer divide as camadas entre as GPUs, e --tensor-split define a proporção atribuída a cada placa. O modo tensor é descrito ali como experimental. A distribuição não acelera a geração como faria uma única placa mais rápida: sua principal função é permitir que um modelo maior caiba na memória.

#Via C: uma única placa de 24 GB, orçamento apertado

Uma RTX 3090 ou 4090 usada, com 24 GB, já dá conta de um modelo MoE de 30 bilhões de parâmetros em Q4 e de um modelo denso de 27 a 32 bilhões com contexto curto. É uma opção para um orçamento limitado a alguns milhares de euros: os preços mudam toda semana, então o acompanhamento de /prix-gpu-ia é a única referência confiável. A margem diminui rapidamente com o contexto: o cache KV, que pode ocupar vários gigabytes, consome os 4 a 5 GB restantes.

Comparar as três opções
CritérioUma placa de 32 GBDuas placas de 24 GBUma placa de 24 GB
VRAM útil32 GB48 GB distribuídos24 GB
ComplexidadeNenhumDistribuição a configurar, duas placas volumosasNenhum
Potência das placas575 W (RTX 5090)2 × 350 W (RTX 3090)350 W (RTX 3090)
AlimentaçãoPelo menos 1 000 W (NVIDIA)Pelo menos 1 200 W recomendados (cálculo deste guia)750 W (NVIDIA)
Maior modelo em Q432B com contexto70B com contexto curto30B especialistas, 32B curto

#O contexto: a memória que sobra na VRAM para o cache KV

O peso do modelo não diz tudo: cada token de contexto adiciona uma entrada ao cache KV, armazenada também em VRAM. A ficha do modelo Qwen3-Coder-30B-A3B indica 48 camadas e atenção agrupada com 32 cabeças de consulta para 4 cabeças KV. Essa estrutura reduz o tamanho do cache KV a um oitavo em comparação com um modelo que tivesse tantas cabeças KV quanto cabeças de consulta, o que explica por que um modelo assim suporta contextos muito longos em uma placa de 24 ou 32 GB. Nem todos os modelos são tão econômicos: quanto mais cabeças KV um modelo tem, mais rápido seu cache cresce com o contexto.

A regra prática continua a mesma: parta do peso do modelo, some 3 a 4 GB de margem e veja o que resta para o contexto desejado. Se a margem for insuficiente, quantize o cache KV em vez de reduzir a quantização do modelo: o guia dedicado explica o equilíbrio entre vantagens e desvantagens.

#CPU, RAM e placa-mãe: não desperdiçar o orçamento

Durante a geração na GPU, o processador trabalha pouco: ele carrega os modelos, tokeniza, prepara o contexto e mantém o sistema funcionando. Um processador intermediário é suficiente, e o dinheiro é melhor investido na VRAM. A placa-mãe importa mais: para duas placas de 24 GB, são necessários dois slots PCIe x16 fisicamente espaçados e espaço suficiente para placas espessas (a NVIDIA descreve a RTX 3090 Founders Edition como uma placa que ocupa três slots). O número de linhas PCIe por slot influencia pouco a geração depois que o modelo é carregado.

Quanto à memória do sistema, 32 GB é o mínimo para um PC com uma placa de 32 GB; 64 GB é mais confortável se você mantiver um IDE, um navegador e um contêiner abertos enquanto o modelo estiver rodando, ou se transferir parte da execução do modelo para o processador. Nesse último caso, a velocidade depende da RAM: veja o guia de LLM sem GPU. Uma busca frequente, "LLM 32 GB RAM", geralmente se refere a essa situação: com 32 GB de RAM e sem placa gráfica, modelos com 7 a 14 bilhões de parâmetros em Q4 continuam utilizáveis; um 32B em Q4 (cerca de 19 a 20 GB) cabe, mas gera lentamente.

#Fonte de alimentação: o componente em que você não deve economizar

A NVIDIA indica uma potência de sistema necessária de 1.000 W para uma RTX 5090 e de 750 W para uma RTX 3090. Para duas RTX 3090, o cálculo é simples: 2 × 350 W das placas, mais cerca de 250 W para o processador, a placa-mãe, os discos e as ventoinhas, resulta em cerca de 950 W sob carga, com picos acima desse valor. Uma fonte de alimentação de 1.200 W ou mais oferece uma boa margem; essa é uma recomendação deste guia, não uma especificação da Apple ou da NVIDIA. Verifique também o número de conectores PCIe de 8 pinos: uma RTX 5090 exige quatro por meio do adaptador, ou um cabo PCIe Gen 5 de 600 W.

!
Não economizar na fonte de alimentação
Uma fonte de alimentação subdimensionada desliga o PC sob carga e, no pior caso, danifica a placa ou a placa-mãe. A geração com um LLM mantém a GPU próxima de sua potência máxima por longos minutos, ao contrário de um jogo, cuja carga varia: dimensione a fonte para o pico contínuo.

#Armazenamento: a velocidade de carregamento, não a capacidade

Um modelo de 20 a 40 GB é carregado a cada troca de modelo. Cálculo com hipóteses a adaptar: a 200 MB/s, a velocidade típica de um disco rígido, 40 GB exigem cerca de 200 segundos; a 3,5 GB/s, a velocidade de um SSD NVMe, cerca de 12 segundos. Um SSD NVMe de 2 TB é suficiente para cerca de dez modelos e um índice de RAG; um segundo disco serve para backups. O ganho de um SSD PCIe 5.0 na geração é nulo: ela ocorre na VRAM.

#Gabinete e refrigeração

Uma placa de 575 W gera tanto calor quanto um pequeno aquecedor: o gabinete deve expulsar o ar quente mais rápido do que ele entra, com entrada de ar frontal e ventoinhas na parte traseira e no topo. Duas placas espessas lado a lado se aquecem mutuamente: deixe um slot livre entre elas ou escolha modelos mais finos. O guia sobre o comportamento térmico durante a inferência detalha as temperaturas a monitorar e as curvas das ventoinhas.

#Validar a configuração antes da compra

  1. 01
    Partir do modelo, não da placa
    Escolha o modelo e a quantização desejados, adicione 3 a 4 GB para o cache KV e o driver: o total dá a VRAM mínima. O calculador de VRAM do site faz esse cálculo.
  2. 02
    Escolher a opção de GPU
    Uma placa de 32 GB para simplificar, duas placas de 24 GB se o orçamento for a prioridade e se o gabinete e a placa-mãe permitirem, uma única placa de 24 GB para um orçamento apertado.
  3. 03
    Dimensionar a fonte de alimentação
    Use pelo menos a potência do sistema indicada pela NVIDIA para a placa, e adicione margem para duas placas. Conte os conectores PCIe.
  4. 04
    Verificar o gabinete
    Comprimento, espessura e circulação de ar para cada placa. Duas placas espessas exigem um gabinete largo e uma placa-mãe com slots espaçados.
  5. 05
    Após a montagem, verificar a carga
    O comando nvidia-smi exibe a VRAM utilizada e a potência de cada placa; o comando ollama ps mostra se o modelo está rodando totalmente na GPU.
Terminal
nvidia-smi
ollama ps

#Perguntas frequentes

FAQ
32 GB de VRAM são suficientes para um modelo com 32 bilhões de parâmetros?+
Sim, em Q4: o modelo pesa cerca de 19 a 20 GB, o que deixa 12 GB para o contexto e o driver. O Q8, em torno de 34 GB, não cabe. Você pode optar por uma quantização intermediária, Q5 ou Q6, se aceitar um contexto mais curto. A calculadora de VRAM do site dá a resposta para o seu modelo.
RTX 5090 ou duas RTX 3090 para 32 GB de VRAM?+
A RTX 5090 oferece 32 GB em uma única placa, sem configuração de múltiplas GPUs, com 575 W. Duas RTX 3090 oferecem 48 GB distribuídos entre elas, com 700 W no total para as placas, e é necessária uma fonte de pelo menos 1.200 W, além de uma placa-mãe adequada. Escolha a 5090 pela simplicidade e as duas 3090 para carregar um 70B.
Qual configuração para rodar o Qwen3-Coder 30B-A3B?+
O modelo conta com 30,5 bilhões de parâmetros, dos quais 3,3 bilhões são ativos, e a biblioteca Ollama anuncia 19 GB para a versão padrão. Uma placa de 24 GB carrega o modelo com um contexto médio; uma de 32 GB deixa margem para um contexto longo. Em Q8, com cerca de 32 GB, ele não cabe em uma única placa de 32 GB.
32 GB de RAM são suficientes para um LLM sem placa de vídeo?+
Sim para modelos de 7 a 14 bilhões de parâmetros em Q4, que pesam de 5 a 9 GB. Um modelo de 32 bilhões em Q4 (cerca de 19 a 20 GB) também cabe, mas gera lentamente, pois a velocidade depende da largura de banda da RAM. O guia do LLM sem GPU detalha os modelos por níveis de RAM.
Qual fonte de alimentação escolher para uma RTX 5090?+
NVIDIA indica 1.000 W de potência necessária para o sistema, com quatro conectores PCIe de 8 pinos via o adaptador fornecido ou um cabo PCIe Gen 5 de 600 W. Escolha uma fonte de alimentação de pelo menos 1.000 W de boa qualidade, com esse cabo nativo se possível, e evite alongar o cabo com adaptadores adicionais.
Onde encontrar os preços atuais das placas gráficas para IA?+
O monitoramento do site registra regularmente o menor preço das placas de vídeo para IA local, junto com o preço por gigabyte de VRAM. Esta página não informa preços: eles mudam todas as semanas. Consulte a página de preços antes de decidir entre uma placa de 32 GB e duas placas usadas de 24 GB.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.