VRAM: o que é e quanta é necessária para a IA ?
A VRAM (Video RAM) é a memória soldada na placa de vídeo, reservada para a GPU: de 8 a 32 GB nas placas voltadas ao consumidor no fim de setembro de 2026, contra até 512 GB de memória unificada em um Mac Studio M5 Ultra. Ela determina diretamente quais modelos de IA local podem ser carregados: um LLM que ultrapassa a capacidade da VRAM passa a usar também a RAM e fica de 5 a 20 vezes mais lento. A capacidade define o que cabe, a largura de banda define a velocidade.
A VRAM, ou memória de vídeo, é a memória soldada à sua placa de vídeo, reservada para a GPU. Ela é muito mais rápida que a RAM do computador e é ela que determina quais modelos de IA você pode rodar localmente: um LLM precisa caber inteiro nela para responder rapidamente. Em 20 de setembro de 2026, as placas voltadas ao consumidor têm de 8 a 32 GB. Esta página explica o que é a VRAM, como descobrir a sua em trinta segundos e o que cada faixa de capacidade realmente permite.
#VRAM em um minuto
VRAM significa Video Random Access Memory. É uma memória de acesso aleatório, como a RAM, mas fica a poucos milímetros do chip gráfico e se conecta a ele por um barramento muito largo. Sua função original é armazenar o que a GPU manipula continuamente: as texturas, a geometria e as imagens de um jogo. Para a IA, ela armazena os pesos do modelo e sua memória de trabalho.
Dois números a caracterizam. A capacidade, em gigabytes, indica o que cabe nela. A largura de banda, em gigabytes por segundo, indica a velocidade com que a GPU pode lê-la. Em jogos, costuma-se olhar principalmente para a capacidade. Na IA, os dois importam: a capacidade determina se o modelo é carregado, e a largura de banda determina a velocidade com que ele escreve.
#RAM e VRAM: as diferenças
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
| RAM (memória do sistema) | VRAM (memória de vídeo) | |
|---|---|---|
| Localização | Módulos de memória na placa-mãe | Chips soldados na placa de vídeo |
| A serviço de | O processador (CPU) | O processador gráfico (GPU) |
| Tecnologia | DDR4, DDR5 | GDDR6, GDDR6X, GDDR7 |
| Largura de banda | 60 a 100 GB/s em DDR5 de canal duplo | 360 GB/s (RTX 3060) a 1 792 GB/s (RTX 5090) |
| Capacidade comum | 16 a 64 GB | 8 a 32 GB |
| Expansível | Sim, é possível adicionar módulos de memória | Não, ela é soldada |
A diferença de largura de banda, da ordem de dez a vinte vezes, explica todo o resto desta página. Um modelo de IA relê todos os seus pesos a cada token que produz. A partir da VRAM, isso é rápido. A partir da RAM, o mesmo modelo roda cinco a vinte vezes mais devagar.
#Conhecer a própria VRAM
- Windows, sem instalar nada
- Abra o Gerenciador de Tarefas (Ctrl + Shift + Esc), selecione a aba Desempenho e depois GPU na coluna da esquerda. A linha “Memória da GPU dedicada” mostra sua VRAM. A “Memória da GPU compartilhada” exibida ao lado não é VRAM: trata-se de RAM que o Windows pode emprestar à GPU, muito mais lenta.
- Windows, método alternativo
- Tecla Windows + R, digite dxdiag, aba Exibição: a linha « Memória de vídeo (VRAM) ».
- Windows e Linux com uma placa NVIDIA
- Em um terminal, o comando nvidia-smi exibe a memória total e a memória ocupada em tempo real. É a ferramenta que deve permanecer aberta enquanto um modelo está em execução.
- Linux com uma placa AMD
- O comando rocm-smi --showmeminfo vram ou a ferramenta gráfica da sua distribuição.
- Mac
- Menu Apple, Sobre Este Mac: a linha Memória. Um Mac com Apple Silicon não tem VRAM separada; ver a seção dedicada mais abaixo.
#Por que a IA local depende da VRAM
Um LLM ocupa a VRAM de três formas. Primeiro, os pesos: o número de parâmetros multiplicado pela precisão. Com quantização de 4 bits, considere cerca de 0,6 GB por bilhão de parâmetros, ou seja, 5 GB para um modelo de 8B. Em seguida, o cache KV, que mantém a conversa em andamento e cresce com o comprimento do contexto. Por fim, uma margem de funcionamento, da ordem de 1 a 2 GB.
Se o total ultrapassar a VRAM, ferramentas como Ollama ou llama.cpp transferem parte do modelo para a RAM: isso é o offload CPU+GPU, uma funcionalidade documentada do projeto llama.cpp para executar modelos maiores que a VRAM disponível. O modelo continua funcionando, mas a velocidade despenca assim que algumas camadas passam para o outro lado, porque cada token precisa então esperar uma leitura na RAM do sistema, dez a vinte vezes mais lenta. É por isso que uma placa mais antiga com muita VRAM, como uma RTX 3090 de 24 GB, continua sendo mais útil em IA local do que uma placa recente de 12 GB, embora seja mais rápida em jogos e renderização 3D.
- Calculadora de VRAM: pesos, contexto e margem para seu modelo
- Escolher sua quantização: Q4, Q5, Q8 ou FP16
#Quanta VRAM para cada modelo
A tabela cruza nossa base de 90 placas e chips com os 249 modelos do catálogo. Para cada nível, indica um modelo representativo que cabe totalmente na VRAM em Q4_K_M. Mantenha 1 a 3 GB de margem para o contexto: quando o peso do modelo se aproxima da capacidade da placa, a conversa deve ser curta.
| VRAM | Placas típicas | Modelo representativo que cabe na VRAM | Pesos em Q4 | Guia detalhado |
|---|---|---|---|---|
| 6 GB | RTX 2060, GTX 1660, RTX 4050 para notebook | Qwen 3 8B, com contexto curto | 5 GB | Qual LLM para 6 GB |
| 8 GB | RTX 3060 Ti, RTX 4060, RTX 5060 | Qwen 3 8B roda com folga, Gemma 4 12B com contexto curto | 5 e 7 GB | Qual LLM para 8 GB |
| 12 GB | RTX 3060 12 GB, RTX 4070, RTX 5070 | Qwen 3 14B | 9 GB | Qual LLM para 12 GB |
| 16 GB | RTX 4060 Ti 16 GB, RTX 5070 Ti, RTX 5080, RX 9070 XT | gpt-oss 20B, Mistral Small 3.2 24B | 13 e 14 GB | Qual LLM para 16 GB |
| 24 GB | RTX 3090, RTX 4090, RX 7900 XTX | Qwen 3.8 27B, Qwen 3.6 35B-A3B | 16 e 21 GB | Qual LLM para 24 GB |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B em Q5 | 25 GB | Qual LLM para 32 GB |
| 48 GB | 2 × RTX 3090 ou 4090, Mac com 64 GB | Llama 3.3 70B | 40 GB | Ver a calculadora |
| 96 GB | Mac 128 GB | gpt-oss 120B | 70 GB | Ver a calculadora |
- Qual LLM para 8 GB de VRAM?
- Qual LLM para 12 GB de VRAM?
- Qual LLM para 16 GB de VRAM?
- Qual LLM para 24 GB de VRAM?
#É possível aumentar a VRAM?
Em uma placa de vídeo dedicada, não, independentemente do fabricante. Os chips de memória são soldados e dimensionados junto com a GPU desde a concepção: a única forma de ter mais VRAM é trocar de placa ou adicionar uma segunda, algo que as ferramentas de IA local conseguem aproveitar distribuindo automaticamente o modelo entre as placas. As configurações que prometem “aumentar a VRAM” no Windows ou no BIOS não criam memória adicional: elas se aplicam a dois casos específicos, descritos abaixo, que não trazem nenhum benefício a uma placa dedicada já plenamente identificada pelo sistema.
- GPU integrada (iGPU)
- Ele não tem VRAM própria e usa uma parte da RAM. O BIOS frequentemente permite aumentar essa parte (configuração UMA Frame Buffer Size ou equivalente). Isso aumenta a capacidade, não a velocidade, que continua sendo a da RAM.
- Memória compartilhada da GPU no Windows
- O Windows permite que uma placa dedicada use a RAM quando sua própria memória não é suficiente. Para um jogo, isso evita um travamento. Para um LLM, é o cenário lento descrito acima.
A verdadeira margem de manobra está no software: escolher uma quantização mais leve, reduzir a janela de contexto, quantizar o cache KV. Essas três medidas costumam economizar vários gigabytes sem alterar o hardware.
#O caso dos Macs: a memória unificada
Os Macs com Apple Silicon não possuem VRAM separada. O processador e a GPU compartilham uma única memória, chamada unificada, com alta largura de banda. Na geração M4: 120 GB/s para o chip básico, até 546 GB/s para um M4 Max. A GPU não pode usar toda essa memória, pois o macOS reserva uma parte; na prática, conte com cerca de 16 GB utilizáveis por um modelo em um Mac de 24 GB, 48 GB em um Mac de 64 GB e 96 GB em um Mac de 128 GB, uma reserva que pesa proporcionalmente mais nas configurações menores.
A linha mudou desde então: a Apple lançou o chip M5 no final de 2025 (153,6 GB/s, máximo de 32 GB de memória), depois o M5 Pro (307 GB/s, 64 GB) e o M5 Max (até 614 GB/s, 128 GB). O Mac Studio veio em seguida com o M5 Ultra, anunciado em 25 de agosto de 2026: a Apple anuncia “até 512 GB” de memória unificada e “1,2 TB/s” de largura de banda, o que teoricamente permite carregar um modelo com várias centenas de bilhões de parâmetros. No mesmo dia, a Apple lançou o M6, fabricado em 2 nm e comercializado desde 22 de setembro de 2026: trata-se apenas de um chip de entrada, sem variantes Pro nem Max nessa geração, limitado a 32 GB de memória e 170 GB/s de largura de banda, ou seja, menos que um M5 Pro lançado um ano antes. Um ponto a verificar antes de comprar um Mac “de última geração” para IA: o nome do chipset não diz tudo, a variante conta mais que o ano de lançamento.
| Chip | Largura de banda | Memória máxima |
|---|---|---|
| M4 | 120 GB/s | 32 GB |
| M4 Pro | 273 GB/s | 64 GB |
| M4 Max | 410 a 546 GB/s | 128 GB |
| M5 | 153,6 GB/s | 32 GB |
| M5 Pro | 307 GB/s | 64 GB |
| M5 Max | até 614 GB/s | 128 GB |
| M5 Ultra | 1,2 TB/s (1 228,8 GB/s) | 512 GB |
| M6 | 170 GB/s | 32 GB |
É isso que torna os Macs de ponta singulares para a IA local: nenhuma placa de vídeo voltada ao consumidor oferece 96 GB de VRAM utilizável, muito menos as centenas de gigabytes de um Mac Studio M5 Ultra. Em contrapartida, com a mesma capacidade, uma placa NVIDIA recente continua sendo mais rápida graças à maior largura de banda por gigabyte: os 1.792 GB/s de uma RTX 5090 com 32 GB superam de longe os 614 GB/s de um M5 Max com 128 GB, mas este último carrega um modelo quatro vezes maior.
- Hardware para IA local: nossas fichas de máquinas
- Qual GPU para um LLM local?
- Fonte: comunicado Apple Newsroom, M6 e M5 Ultra (25/08/2026)
- Fonte: ficha técnica NVIDIA GeForce RTX 5090
- Fonte: repositório GitHub llama.cpp (distribuição multi-GPU)
#FAQ
Qual é a diferença entre RAM e VRAM?+
8 GB de VRAM são suficientes em 2026?+
Por que o Windows exibe mais memória de GPU do que a minha placa tem?+
Duas placas gráficas somam sua VRAM?+
A VRAM importa mais do que a potência da GPU para a IA local?+
Hardware recomendado: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) — 16 GB de VRAM, suficientes para carregar um modelo 14B quantizado em Q4 com seu contexto. Todo o hardware de IA →
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.