Iniciante 8 minPor VRAM

Qual LLM para 4 GB de VRAM ?

4 GB de VRAM são o mínimo absoluto para rodar um LLM localmente em 2026. GTX 1650, GTX 1050 Ti, RTX 3050 Mobile… placas antigas ou de entrada muito básica. Você ainda pode instalar Ollama e conversar com Qwen 3.5 2B ou Granite 4.2 3B. Este guia explica exatamente o que funciona, o que não funciona e como aproveitar ao máximo esses 4 GB.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-08-27·Testado no Windows, macOS e Linux
Hardware recomendado

Para passar para 16 GB de VRAM: RTX 5060 Ti 16 GB.

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#4 GB de VRAM em 2026

i
O mínimo essencial
4 GB de VRAM = você pode testar um LLM localmente, mas com limitações sérias. Um modelo de 8B de 2026 como Granite 4.2 8B Q4 (5,3 GB) ultrapassa esse limite — fique com modelos de 2B a 4B que caibam com folga.

#1. Quais GPUs têm 4 GB

GTX 1650 (4 GB)
Pascal-Turing 2019. Difícil de encontrar nova hoje; usada, tem preço variável.
GTX 1050 Ti (4 GB)
Pascal 2016. Antiga, mas ainda funcional. Usada, com preço variável.
RTX 3050 Mobile 4 GB
Versão de entrada para notebook.
GTX 1630 (4 GB)
Ultra-básico, evite — desempenho insuficiente mesmo para LLM leve.

#2. Modelos utilizáveis

4 GB de VRAM — modelos LLM 2026
ModeloQuantVRAMOK?
Gemma 4 2BQ5_K_M1,4 GB★★★★★ confortável
Qwen 3.5 2BQ4_K_M1,9 GB★★★★★ confortável
Granite 4.2 3BQ4_K_M2,2 GB★★★★★
Qwen 3.5 4BQ4_K_M2,3 GB★★★★
Gemma 4 E2BQAT4,3 GB⚠️ no limite (4 GB)
Granite 4.2 8BQ4_K_M5,3 GB❌ ultrapassa

#3. Dicas para aproveitar ao máximo 4 GB

Cache KV Q4
OLLAMA_KV_CACHE_TYPE=q4_0 (em vez de q8_0). Mais agressivo, economiza 50 % do cache.
Contexto máximo de 2k
Acima desse limite, tudo estoura a capacidade da memória. 2k tokens = ~5–10 frases em francês, o suficiente para um bate-papo simples.
Feche tudo o resto
Chrome acelerado com GPU, Discord, OBS — tudo consome VRAM. Modo minimalista obrigatório.
Sem RAG
Embeddings + LLM = demais. Continue com conversas simples sem documentos.

#Atualização recomendada

RTX 3060 12 GB (usada, preço variável)
O salto mais rentável. +200% de VRAM, acesso aos modelos de 14B. Melhor upgrade possível para LLMs.
RTX 5050 8 GB (preço da placa nova a verificar, não monitorada)
Se você quer uma placa nova. +100% de VRAM, FP4 preparado para o futuro.
Mac mini M4 16 GB (geralmente substituído por M5/M6; verificar)
Se você mudar de plataforma. Memória unificada, silencioso.

#Perguntas frequentes

É possível rodar um modelo de 7-8B com 4 GB de VRAM?+
Não de forma confortável. Um modelo 8B de 2026, como o Granite 4.2 8B Q4 (5,3 GB), excede a VRAM disponível. Fique com o Granite 4.2 3B Q4 (2,2 GB) — qualidade adequada, velocidade adequada.
Qual o melhor LLM para 4 GB de VRAM?+
Granite 4.2 3B Q4_K_M ou Qwen 3.5 4B Q4. Excelentes pequenos modelos de 2026, qualidade muito superior a um 7B há 2 anos.
A GTX 1650 com 4 GB é suficiente para explorar a IA local?+
Sim para modelos 2B-3B. Você instala Ollama, fala com o Granite 4.2 3B a 25-30 tok/s. Suficiente para começar.
É mesmo necessário ter uma GPU? Minha CPU pode ser suficiente?+
Em CPUs recentes (Ryzen 5 7600+, Core i5 13ª geração+), o Granite 4.2 8B em Q4 roda a 5-10 tok/s. Lento, mas utilizável. Em uma GPU com 4 GB de memória, você obtém cerca de 20 tok/s com um modelo de 3B — preferível.
É possível fazer RAG com 4 GB de VRAM?+
Não de forma confortável. Embeddings BGE-M3 (~2 GB) + LLM 3B (~2 GB) = saturação. Continue com o chat simples ou passe para 8 GB ou mais.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.