Avançado 11 minPor VRAM

Qual LLM para 32 GB de VRAM ?

Resposta direta

Com 32 GB de VRAM, você carrega inteiramente um modelo denso de 27 a 32B em Q4 (16 a 20 GB) com contexto longo, um MoE de 30-35B (19 a 21 GB) ou gpt-oss-20b (14 GB) com bastante margem. O modelo de 70B já não cabe: ocupa de 40 a 43 GB em Q4, portanto fica necessariamente em parte na memória RAM, onde a velocidade despenca. Sempre contabilize o cache de contexto além dos pesos.

32 GB de VRAM é o patamar em que deixamos de ter que escolher entre o tamanho do modelo e o comprimento do contexto. Esta página mostra o que realmente cabe, o que muda conforme a placa (RTX 5090 ou Radeon AI PRO R9700), por que um 70B ou um 123B não passa a rodar de forma confortável e quando a memória unificada de um Mac ou uma segunda placa é uma compra mais vantajosa.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux
Hardware recomendado

Boa relação custo-benefício para IA local: um GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).

Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.

Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Orçamento apertado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#32 GB de VRAM: o que a capacidade muda em relação a 24 GB

Um modelo em Q4 ocupa cerca de 0,6 GB por bilhão de parâmetros, além do cache de contexto, que cresce com a duração da conversa. Com 24 GB, um modelo denso de 27 a 32B em Q4 (16 a 20 GB) cabe, mas o contexto deve permanecer curto. Com 32 GB, restam 12 a 16 GB para o contexto, as ativações e o sistema: é essa memória disponível que permite janelas de 32.000 a 128.000 tokens em um modelo de 27B, ou um MoE de 30-35B com margem confortável.

Capacidade de 32 GB para alguns modelos comuns (pesos em Q4, sem incluir a memória do contexto)
ModeloPesos Q4Restante para o contexto e o sistemaVeredito
gpt-oss-20b14 GB18 GBMargem muito ampla, contexto longo
Qwen 3.5 27B / Qwen 3.8 27B16 GB16 GBConfortável, contexto longo possível
Gemma 4 31B18 GB14 GBConfortável
Qwen 3 32B19-20 GB12 GBBom, contexto a monitorar
Qwen3-Coder 30B-A3B (MoE)19 GB13 GBBom, muito rápido para o seu tamanho
Qwen 3.6 35B-A3B (MoE)21 GB11 GBBom, contexto médio
Llama 3.3 70B43 GBnegativoNão cabe na VRAM: offload obrigatório

Esses valores são tamanhos de arquivos, não requisitos totais: a calculadora do site acrescenta o cache para um modelo e um contexto específicos. O cache também pode ser quantizado em q8_0, o que, segundo a FAQ do Ollama, reduz seu tamanho aproximadamente à metade em relação a f16, desde que o Flash Attention esteja ativado.

#Quais placas oferecem 32 GB e por que a largura de banda importa

Duas placas para computadores de mesa se destacam. A GeForce RTX 5090 tem 32 GB de GDDR7 em um barramento de 512 bits, com 1.792 GB/s de largura de banda segundo a NVIDIA. A Radeon AI PRO R9700 da AMD também oferece 32 GB, mas em GDDR6 em um barramento de 256 bits, a 640 GB/s segundo a AMD, para um computador de mesa e uso profissional. A capacidade é idêntica; a velocidade de geração não é.

Duas placas de 32 GB: mesma capacidade, taxa de transferência teórica muito diferente
PlacaMemóriaLargura de bandaLimite para um modelo de 19 GB
GeForce RTX 509032 GB GDDR7, 512 bits1 792 GB/saproximadamente 94 t/s
Radeon AI PRO R970032 GB GDDR6, 256 bits640 GB/scerca de 34 t/s

O limite é calculado dividindo a largura de banda pelos pesos lidos a cada token; ele nunca é atingido completamente, mas a relação permanece válida: para o mesmo modelo, a RTX 5090 gera tokens a uma velocidade mais de duas vezes maior que a da R9700. Para uma placa AMD, o driver e a pilha de software (ROCm, Vulkan) também contam; o guia dedicado às placas AMD detalha as limitações. Cada placa específica tem sua própria página: a da RTX 5090 fornece os detalhes da placa.

Duas outras opções atingem 32 GB. Duas placas de 16 GB dividem um modelo entre si com llama.cpp, mas a conexão PCIe torna as trocas mais lentas e o modelo precisa poder ser dividido adequadamente; o guia multi-GPU explica o método. Um Mac com memória unificada de 32 GB ou mais é uma terceira opção, com largura de banda menor, mas sem limite de VRAM dedicada.

Os preços mudam rápido: o monitoramento do site registra toda segunda-feira e toda quinta-feira o menor preço das placas gráficas para IA local, junto com o preço por GB de VRAM.

#Modelos a priorizar com 32 GB

Modelos densos de 27 a 32B
A escolha de qualidade: Qwen 3.5 27B ou 3.8 27B (16 GB em Q4), Gemma 4 31B (18 GB), Qwen 3 32B (19 a 20 GB). Eles deixam espaço para um contexto longo e se adaptam bem a quantificações mais finas (Q5, Q6) se você quiser mais qualidade.
MoE 30–35B
Qwen3-Coder 30B-A3B (19 GB) e Qwen 3.6 35B-A3B (21 GB) ativam apenas cerca de 3 bilhões de parâmetros por token: oferecem a melhor velocidade em relação ao tamanho e são a escolha certa para programação e agentes.
gpt-oss-20b
14 GB na biblioteca Ollama; a página Ollama indica que ele pode rodar em sistemas com pelo menos 16 GB de memória. Em 32 GB, deixa um contexto imenso e permite manter um segundo modelo carregado ao mesmo tempo.
Modelo de código de 24B
Devstral Small 2 24B (14 GB): um especialista em agentes de código que deixa espaço para dois modelos residentes na memória.

Para escolher, faça três perguntas. O modelo precisa lidar com um contexto longo (documentos, repositório de código)? Escolha um modelo denso de 27B em Q4, que deixa 16 GB para o cache. Precisa de velocidade (agentes, loops de ferramentas)? Use o MoE. Quer simplesmente mais qualidade do que com 24 GB? Passe de Q4 para Q6 em um modelo de 27 a 32B: há espaço.

#Verificar se o modelo realmente cabe na placa

Um modelo que “carrega” não está necessariamente inteiramente na GPU. O Ollama distribui silenciosamente as camadas entre a placa e a memória RAM quando falta VRAM, e a velocidade cai sem mensagem de erro. A FAQ oficial indica que o comando ollama ps mostra na coluna Processor onde o modelo foi carregado: 100 % GPU significa que ele está inteiramente na GPU; uma distribuição como 30 %/70 % CPU/GPU indica que parte do modelo foi transferida para a RAM.

  1. 01
    Carregar o modelo com o contexto pretendido
    Inicie o modelo com o tamanho de contexto que você realmente usa, não com o valor padrão: é o cache de contexto que faz o uso de memória ultrapassar a capacidade disponível.
  2. 02
    Ler a coluna Processor
    Execute ollama ps em outro terminal. Busque 100% de GPU; qualquer parcela de processamento na CPU reduz a velocidade.
  3. 03
    Reduza se necessário
    Se o modelo ultrapassar o limite, reduza o contexto, ative a quantização do cache em q8_0 com Flash Attention ou passe para uma quantização mais leve.
  4. 04
    Verificar a VRAM restante
    No Windows ou Linux, o nvidia-smi exibe a memória usada; mantenha uma margem de um a dois GB para a exibição e os picos.
  5. 05
    Medir com base no seu uso
    Compare a taxa de transferência usando um prompt curto e o seu prompt real: é o segundo número que importa.
!
A armadilha do contexto padrão
Ollama utiliza por padrão uma janela de contexto de 4.096 tokens, de acordo com sua FAQ. Um modelo pode parecer caber na VRAM com essa configuração e exceder sua capacidade assim que você aumentar para 32.000 tokens para analisar um documento. Teste sempre com o contexto de que você precisa.

#70B e 123B: por que o offload não torna esses modelos utilizáveis

Llama 3.3 70B pesa 43 GB na biblioteca Ollama, e Mistral Large 123B, 73 GB. Com 32 GB de VRAM, é necessário deixar pelo menos 11 GB do 70B e 41 GB do 123B na memória RAM. A cada token, essas camadas são lidas pelo processador à velocidade da memória do sistema: cerca de 102 GB/s no máximo para DDR5-6400 em dois canais (6.400 MT/s × 8 bytes × 2). Dividindo essa taxa por 41 GB, o limite teórico do 123B é de cerca de 2,5 tokens por segundo; para o 70B, com 11 GB na RAM, de cerca de 9 tokens por segundo. São limites teóricos, não medições: eles mostram principalmente que a taxa de geração não diminui de forma progressiva, mas em degraus, assim que as camadas deixam a placa.

Resultados de um modelo que excede os 32 GB de VRAM (cálculo a partir da memória do sistema)
ModeloTamanho de OllamaVai para a RAM do sistemaLimite da RAM (102 GB/s)
Llama 3.3 70B43 GBcerca de 11 GB (34%)aproximadamente 9 t/s
Mistral Large 123B73 GBaproximadamente 41 GB (56 %)aproximadamente 2,5 t/s

Esse cálculo supõe que a placa mantenha 32 GB de pesos do modelo; na prática, o cache de contexto também ocupa espaço, então uma parcela maior dos pesos vai para a RAM e o limite diminui. Os MoE se comportam melhor: o llama.cpp oferece uma opção para manter os especialistas de determinadas camadas no processador (--n-cpu-moe), para configurações que não conseguem carregar o modelo inteiro na GPU. Essa opção permite executar um modelo que não cabe na GPU, mas um usuário do repositório llama.cpp relata uma perda de velocidade de cerca de 80% ao colocar todos os especialistas na CPU: é uma solução de último recurso.

Um MoE grande demais: manter especialistas na CPU (llama.cpp)
llama-server -m modele-moe.gguf -ngl 99 -fa --n-cpu-moe 12 -c 16384

O valor de --n-cpu-moe depende da sua memória; é preciso encontrá-lo por tentativa e erro. Para um 70B denso, a resposta certa com 32 GB quase sempre é um modelo menor ou mais memória, não fazer offload.

#Fazer o ajuste fino de um modelo com 32 GB: o que cabe e o que não cabe

O ajuste fino com QLoRA mantém os pesos do modelo em 4 bits e treina apenas pequenos adaptadores. Só os pesos de um modelo de 70B já ocupam 40 GB, então um ajuste fino com QLoRA em um modelo de 70B não cabe em 32 GB. Um modelo de 32B em 4 bits ocupa cerca de 19 a 20 GB: restam 12 GB para as ativações, o otimizador e os adaptadores, o que é viável com um contexto curto e um lote de 1, sem margem de segurança. Um modelo de 7 a 14B roda com folga. São ordens de grandeza a confirmar na ferramenta que você usa.

#32 GB de VRAM ou outra solução: a tabela de decisão

O que escolher de acordo com sua necessidade
NecessidadeSoluçãoPor quê
Modelo denso de 27-32B, contexto longo, velocidade máximaPlaca NVIDIA de 32 GBAlta largura de banda, ecossistema CUDA
Mesma capacidade com menor consumo de energiaRadeon AI PRO R9700Mesma capacidade de 32 GB, largura de banda teórica menor
Modelos de 64 GB ou mais, uso ocasionalMac com memória unificada de 64 GB ou maisCapacidade sem offload, velocidade menor
Orçamento limitado, modelo MoE de 30BUma placa de 24 GB costuma ser suficienteO MoE de 19 GB cabe com um contexto moderado

#Perguntas frequentes

FAQ
Qual é o melhor LLM para 32 GB de VRAM?+
Para qualidade, um modelo denso de 27 a 32B em Q4 (Qwen 3.5 ou 3.8 27B, Gemma 4 31B, Qwen 3 32B) com um contexto longo. Para velocidade e código, um MoE de 30-35B como Qwen3-Coder 30B-A3B. Nenhum modelo é melhor em termos absolutos: a tarefa e o idioma decidem.
32 GB de VRAM são suficientes para o Mistral Large 123B?+
Não. A biblioteca Ollama indica 73 GB para Mistral Large 123B. Mais de 40 GB devem permanecer na memória RAM, onde a leitura é limitada a cerca de 100 GB/s, o que dá um limite teórico de 2 a 3 tokens por segundo. É utilizável para processamento em segundo plano, mas não para um chat.
RTX 5090 ou Mac Studio de 64 GB para IA local?+
A placa para a velocidade: 1 792 GB/s contra algumas centenas de GB/s em um Mac, em modelos que cabem em 32 GB. O Mac para a capacidade: um modelo de 40 a 50 GB cabe nele sem offload, a uma velocidade menor. Escolha conforme o tamanho dos modelos que você carrega.
Uma segunda placa de 16 GB equivale a uma placa de 32 GB?+
Duas placas de 16 GB somam 32 GB, mas o modelo é distribuído entre elas e a conexão PCIe torna as trocas de dados mais lentas; a distribuição também exige configuração no llama.cpp. Uma placa de 32 GB é mais simples e mais rápida para o mesmo total, a menos que você já tenha uma das duas placas.
É possível carregar dois modelos ao mesmo tempo em 32 GB?+
Sim, por exemplo gpt-oss-20b (14 GB) e Devstral Small 2 24B (14 GB), totalizando 28 GB de pesos, com um contexto curto. Ollama mantém os modelos na memória por cinco minutos por padrão e pode manter vários se a memória permitir; monitore o cache de contexto, que se soma aos pesos de cada modelo.
Qual quantização escolher em 32 GB?+
Q4_K_M continua sendo o melhor equilíbrio para modelos densos de 27 a 32B. Se você tiver margem (modelo com 14 a 16 GB de pesos), passe para Q5 ou Q6 para melhorar a qualidade. Só use uma quantização abaixo de Q4 para fazer caber um modelo grande demais, aceitando uma perda de qualidade.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.