Iniciante 11 minConceitos

VRAM: o que é e quanta é necessária para a IA ?

Resposta direta

A VRAM (Video RAM) é a memória soldada na placa de vídeo, reservada para a GPU: de 8 a 32 GB nas placas voltadas ao consumidor no fim de setembro de 2026, contra até 512 GB de memória unificada em um Mac Studio M5 Ultra. Ela determina diretamente quais modelos de IA local podem ser carregados: um LLM que ultrapassa a capacidade da VRAM passa a usar também a RAM e fica de 5 a 20 vezes mais lento. A capacidade define o que cabe, a largura de banda define a velocidade.

A VRAM, ou memória de vídeo, é a memória soldada à sua placa de vídeo, reservada para a GPU. Ela é muito mais rápida que a RAM do computador e é ela que determina quais modelos de IA você pode rodar localmente: um LLM precisa caber inteiro nela para responder rapidamente. Em 20 de setembro de 2026, as placas voltadas ao consumidor têm de 8 a 32 GB. Esta página explica o que é a VRAM, como descobrir a sua em trinta segundos e o que cada faixa de capacidade realmente permite.

Por Mohamed Meguedmi·Atualização 2026-09-28·Testado no Windows, macOS e Linux

#VRAM em um minuto

VRAM significa Video Random Access Memory. É uma memória de acesso aleatório, como a RAM, mas fica a poucos milímetros do chip gráfico e se conecta a ele por um barramento muito largo. Sua função original é armazenar o que a GPU manipula continuamente: as texturas, a geometria e as imagens de um jogo. Para a IA, ela armazena os pesos do modelo e sua memória de trabalho.

Dois números a caracterizam. A capacidade, em gigabytes, indica o que cabe nela. A largura de banda, em gigabytes por segundo, indica a velocidade com que a GPU pode lê-la. Em jogos, costuma-se olhar principalmente para a capacidade. Na IA, os dois importam: a capacidade determina se o modelo é carregado, e a largura de banda determina a velocidade com que ele escreve.

#RAM e VRAM: as diferenças

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias
Larguras de banda: especificações dos fabricantes
RAM (memória do sistema)VRAM (memória de vídeo)
LocalizaçãoMódulos de memória na placa-mãeChips soldados na placa de vídeo
A serviço deO processador (CPU)O processador gráfico (GPU)
TecnologiaDDR4, DDR5GDDR6, GDDR6X, GDDR7
Largura de banda60 a 100 GB/s em DDR5 de canal duplo360 GB/s (RTX 3060) a 1 792 GB/s (RTX 5090)
Capacidade comum16 a 64 GB8 a 32 GB
ExpansívelSim, é possível adicionar módulos de memóriaNão, ela é soldada

A diferença de largura de banda, da ordem de dez a vinte vezes, explica todo o resto desta página. Um modelo de IA relê todos os seus pesos a cada token que produz. A partir da VRAM, isso é rápido. A partir da RAM, o mesmo modelo roda cinco a vinte vezes mais devagar.

#Conhecer a própria VRAM

Windows, sem instalar nada
Abra o Gerenciador de Tarefas (Ctrl + Shift + Esc), selecione a aba Desempenho e depois GPU na coluna da esquerda. A linha “Memória da GPU dedicada” mostra sua VRAM. A “Memória da GPU compartilhada” exibida ao lado não é VRAM: trata-se de RAM que o Windows pode emprestar à GPU, muito mais lenta.
Windows, método alternativo
Tecla Windows + R, digite dxdiag, aba Exibição: a linha « Memória de vídeo (VRAM) ».
Windows e Linux com uma placa NVIDIA
Em um terminal, o comando nvidia-smi exibe a memória total e a memória ocupada em tempo real. É a ferramenta que deve permanecer aberta enquanto um modelo está em execução.
Linux com uma placa AMD
O comando rocm-smi --showmeminfo vram ou a ferramenta gráfica da sua distribuição.
Mac
Menu Apple, Sobre Este Mac: a linha Memória. Um Mac com Apple Silicon não tem VRAM separada; ver a seção dedicada mais abaixo.
Monitorar a VRAM enquanto um modelo está rodando (NVIDIA)
nvidia-smi --query-gpu=name,memory.total,memory.used --format=csv -l 2

#Por que a IA local depende da VRAM

Um LLM ocupa a VRAM de três formas. Primeiro, os pesos: o número de parâmetros multiplicado pela precisão. Com quantização de 4 bits, considere cerca de 0,6 GB por bilhão de parâmetros, ou seja, 5 GB para um modelo de 8B. Em seguida, o cache KV, que mantém a conversa em andamento e cresce com o comprimento do contexto. Por fim, uma margem de funcionamento, da ordem de 1 a 2 GB.

Se o total ultrapassar a VRAM, ferramentas como Ollama ou llama.cpp transferem parte do modelo para a RAM: isso é o offload CPU+GPU, uma funcionalidade documentada do projeto llama.cpp para executar modelos maiores que a VRAM disponível. O modelo continua funcionando, mas a velocidade despenca assim que algumas camadas passam para o outro lado, porque cada token precisa então esperar uma leitura na RAM do sistema, dez a vinte vezes mais lenta. É por isso que uma placa mais antiga com muita VRAM, como uma RTX 3090 de 24 GB, continua sendo mais útil em IA local do que uma placa recente de 12 GB, embora seja mais rápida em jogos e renderização 3D.

#Quanta VRAM para cada modelo

A tabela cruza nossa base de 90 placas e chips com os 249 modelos do catálogo. Para cada nível, indica um modelo representativo que cabe totalmente na VRAM em Q4_K_M. Mantenha 1 a 3 GB de margem para o contexto: quando o peso do modelo se aproxima da capacidade da placa, a conversa deve ser curta.

Calculado a partir do catálogo e da base de hardware QuelLLM · pesos em Q4_K_M · 20/09/2026
VRAMPlacas típicasModelo representativo que cabe na VRAMPesos em Q4Guia detalhado
6 GBRTX 2060, GTX 1660, RTX 4050 para notebookQwen 3 8B, com contexto curto5 GBQual LLM para 6 GB
8 GBRTX 3060 Ti, RTX 4060, RTX 5060Qwen 3 8B roda com folga, Gemma 4 12B com contexto curto5 e 7 GBQual LLM para 8 GB
12 GBRTX 3060 12 GB, RTX 4070, RTX 5070Qwen 3 14B9 GBQual LLM para 12 GB
16 GBRTX 4060 Ti 16 GB, RTX 5070 Ti, RTX 5080, RX 9070 XTgpt-oss 20B, Mistral Small 3.2 24B13 e 14 GBQual LLM para 16 GB
24 GBRTX 3090, RTX 4090, RX 7900 XTXQwen 3.8 27B, Qwen 3.6 35B-A3B16 e 21 GBQual LLM para 24 GB
32 GBRTX 5090Qwen 3.6 35B-A3B em Q525 GBQual LLM para 32 GB
48 GB2 × RTX 3090 ou 4090, Mac com 64 GBLlama 3.3 70B40 GBVer a calculadora
96 GBMac 128 GBgpt-oss 120B70 GBVer a calculadora
→
O que fazer antes de comprar
Com o mesmo orçamento, para IA local, priorize a capacidade de VRAM antes da geração da placa. Passar de 12 para 16 GB abre a classe de modelos de 20 a 24 bilhões de parâmetros; passar de 16 para 24 GB abre a de 27 a 35 bilhões. Nenhum ganho de velocidade compensa um modelo que não carrega.

#É possível aumentar a VRAM?

Em uma placa de vídeo dedicada, não, independentemente do fabricante. Os chips de memória são soldados e dimensionados junto com a GPU desde a concepção: a única forma de ter mais VRAM é trocar de placa ou adicionar uma segunda, algo que as ferramentas de IA local conseguem aproveitar distribuindo automaticamente o modelo entre as placas. As configurações que prometem “aumentar a VRAM” no Windows ou no BIOS não criam memória adicional: elas se aplicam a dois casos específicos, descritos abaixo, que não trazem nenhum benefício a uma placa dedicada já plenamente identificada pelo sistema.

GPU integrada (iGPU)
Ele não tem VRAM própria e usa uma parte da RAM. O BIOS frequentemente permite aumentar essa parte (configuração UMA Frame Buffer Size ou equivalente). Isso aumenta a capacidade, não a velocidade, que continua sendo a da RAM.
Memória compartilhada da GPU no Windows
O Windows permite que uma placa dedicada use a RAM quando sua própria memória não é suficiente. Para um jogo, isso evita um travamento. Para um LLM, é o cenário lento descrito acima.

A verdadeira margem de manobra está no software: escolher uma quantização mais leve, reduzir a janela de contexto, quantizar o cache KV. Essas três medidas costumam economizar vários gigabytes sem alterar o hardware.

#O caso dos Macs: a memória unificada

Os Macs com Apple Silicon não possuem VRAM separada. O processador e a GPU compartilham uma única memória, chamada unificada, com alta largura de banda. Na geração M4: 120 GB/s para o chip básico, até 546 GB/s para um M4 Max. A GPU não pode usar toda essa memória, pois o macOS reserva uma parte; na prática, conte com cerca de 16 GB utilizáveis por um modelo em um Mac de 24 GB, 48 GB em um Mac de 64 GB e 96 GB em um Mac de 128 GB, uma reserva que pesa proporcionalmente mais nas configurações menores.

A linha mudou desde então: a Apple lançou o chip M5 no final de 2025 (153,6 GB/s, máximo de 32 GB de memória), depois o M5 Pro (307 GB/s, 64 GB) e o M5 Max (até 614 GB/s, 128 GB). O Mac Studio veio em seguida com o M5 Ultra, anunciado em 25 de agosto de 2026: a Apple anuncia “até 512 GB” de memória unificada e “1,2 TB/s” de largura de banda, o que teoricamente permite carregar um modelo com várias centenas de bilhões de parâmetros. No mesmo dia, a Apple lançou o M6, fabricado em 2 nm e comercializado desde 22 de setembro de 2026: trata-se apenas de um chip de entrada, sem variantes Pro nem Max nessa geração, limitado a 32 GB de memória e 170 GB/s de largura de banda, ou seja, menos que um M5 Pro lançado um ano antes. Um ponto a verificar antes de comprar um Mac “de última geração” para IA: o nome do chipset não diz tudo, a variante conta mais que o ano de lançamento.

Chips Apple Silicon: memória unificada e largura de banda (comparação de M4 a M6)
ChipLargura de bandaMemória máxima
M4120 GB/s32 GB
M4 Pro273 GB/s64 GB
M4 Max410 a 546 GB/s128 GB
M5153,6 GB/s32 GB
M5 Pro307 GB/s64 GB
M5 Maxaté 614 GB/s128 GB
M5 Ultra1,2 TB/s (1 228,8 GB/s)512 GB
M6170 GB/s32 GB

É isso que torna os Macs de ponta singulares para a IA local: nenhuma placa de vídeo voltada ao consumidor oferece 96 GB de VRAM utilizável, muito menos as centenas de gigabytes de um Mac Studio M5 Ultra. Em contrapartida, com a mesma capacidade, uma placa NVIDIA recente continua sendo mais rápida graças à maior largura de banda por gigabyte: os 1.792 GB/s de uma RTX 5090 com 32 GB superam de longe os 614 GB/s de um M5 Max com 128 GB, mas este último carrega um modelo quatro vezes maior.

#FAQ

Qual é a diferença entre RAM e VRAM?+
A RAM atende ao processador e fica na placa-mãe; a VRAM atende à GPU e é soldada na placa de vídeo. A VRAM tem uma largura de banda de dez a vinte vezes maior, mas está disponível em menor quantidade e não pode ser expandida. Um modelo de IA que cabe na VRAM responde muito mais rápido do que quando parte dele precisa ficar na RAM.
8 GB de VRAM são suficientes em 2026?+
Para jogar em 1080p, sim, na maioria dos casos. Para IA local, 8 GB permitem executar modelos de até 12 bilhões de parâmetros em Q4, como a Gemma 4 12B, desde que você mantenha um contexto curto; um modelo de 8B roda com mais folga. É um bom ponto de partida, mas rapidamente se torna limitante se você quiser modelos de 20 bilhões de parâmetros ou mais.
Por que o Windows exibe mais memória de GPU do que a minha placa tem?+
O Gerenciador de Tarefas soma dois números diferentes: a memória dedicada, sua VRAM real soldada na placa, e a memória compartilhada, uma parte da RAM do sistema que o Windows permite que a GPU use emprestada quando necessário. Apenas a memória dedicada conta para avaliar o que um modelo de IA pode carregar e executar à velocidade máxima: assim que um LLM passa a usar a memória compartilhada, a geração fica muito mais lenta, exatamente como se ele estivesse rodando na CPU.
Duas placas gráficas somam sua VRAM?+
Para a IA, sim: motores de inferência como llama.cpp, Ollama ou vLLM conseguem distribuir as camadas de um modelo entre várias GPUs, de modo que duas placas de 24 GB permitem carregar um modelo que pesa até 40-45 GB na prática. Para jogos, a resposta é não: cada placa continua trabalhando com sua própria memória, sem possibilidade de somar a memória das duas.
A VRAM importa mais do que a potência da GPU para a IA local?+
Para rodar um modelo, sim: a capacidade determina o que pode ser carregado na memória, e a largura de banda da memória define então a velocidade de geração token a token, muito mais do que a capacidade bruta de processamento da GPU. Esta última pesa principalmente na leitura do prompt inicial e na geração de imagens, duas tarefas que exigem muito mais processamento puro do que leitura repetida da memória.

Hardware recomendado: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) — 16 GB de VRAM, suficientes para carregar um modelo 14B quantizado em Q4 com seu contexto. Todo o hardware de IA →

Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.