Iniciante 11 minPor VRAM

Qual LLM para 6 GB de VRAM ?

Resposta direta

Com 6 GB de VRAM, um modelo de 4 bilhões de parâmetros em Q4 ou Q5 cabe com folga, com um contexto de vários milhares de tokens. Um modelo de 7 a 8 bilhões de parâmetros em Q4 (4,6 a 5,2 GB) ainda pode ser carregado, mas sem margem: o contexto e a memória reservada pelo driver fazem com que parte dele passe a ser executada no processador. Outro ponto que surpreende: nas placas de 6 GB, é a largura de banda da memória, e não a capacidade, que determina a velocidade, e ela pode variar em uma proporção de até dois para um.

6 GB é a faixa de capacidade da GTX 1660, da RTX 2060 e da RTX 3050 6 GB. Essa capacidade é suficiente para um verdadeiro assistente local, desde que você escolha o modelo certo e contabilize também a memória usada além da ocupada pelo modelo. Esta página explica quais modelos cabem, qual placa de 6 GB é mais rápida do que outra, como verificar se um modelo permanece inteiramente na placa e o que mudaria com 12 GB.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux
Hardware recomendado

Para passar para 16 GB de VRAM: RTX 5060 Ti 16 GB.

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#O que 6 GB permitem: cálculo completo de memória

A VRAM não contém apenas os pesos. Ela também aloca o cache de contexto, que cresce com a conversa, os buffers de cálculo do motor e, no Windows, parte da exibição e do navegador. Em uma placa de 6 GB, pode-se considerar um orçamento de cerca de 5 a 5,5 GB para o modelo e seu cache, o restante sendo ocupado pelo sistema. A referência do site para os pesos em Q4 é 3B ≈ 2 GB, 7-8B ≈ 5 GB.

O que cabe em 6 GB (tamanho em Q4, sem contar a memória do contexto)
ModeloPesos Q4Margem disponível em 5,5 GBVeredito
Gemma 4 2B1,2 GB4,3 GBMargem muito ampla, respostas curtas e rápidas
Qwen 3.5 4B2,3 GB3,2 GBConfortável, contexto de milhares de tokens
Phi-4 Mini 3.8B3 GB2,5 GBConfortável
Granite 4.2 8B4,6 GB0,9 GBNo limite: contexto muito curto
Qwen 3 8B (Ollama)5,2 GB0,3 GBExcede a memória disponível assim que o contexto aumenta
Qwen 3.5 9B6 GBnegativaNão cabe

Os tamanhos vêm do catálogo QuelLLM e da biblioteca Ollama. A coluna "margem" é uma estimativa: ela pressupõe 5,5 GB utilizáveis, o que depende do seu sistema e dos seus aplicativos. Um modelo de 8B é, portanto, possível no papel, mas deixa menos de um gigabyte para o cache: é o ajuste de contexto que determina se a experiência é fluida ou se as camadas passam a ser executadas no processador.

#Três placas de 6 GB, três velocidades: a largura de banda

A velocidade de geração é limitada pela largura de banda da memória, dividida pelo tamanho dos pesos lidos a cada token. Duas placas de 6 GB não são, portanto, equivalentes. De acordo com a tabela da Wikipédia sobre a geração GeForce 20, a RTX 2060 6 GB oferece 336 GB/s em um barramento de 192 bits. A RTX 3050 6 GB, mais recente, tem apenas um barramento de 96 bits (NVIDIA) e 168 GB/s segundo a mesma enciclopédia: a metade.

Limite teórico de geração conforme a placa (largura de banda ÷ peso)
Placa de 6 GBLargura de bandaModelo de 2,3 GB (4B Q4)Modelo de 4,6 GB (8B Q4)
RTX 2060 6 GB336 GB/scerca de 146 t/scerca de 73 t/s
RTX 3050 6 GB168 GB/scerca de 73 t/saproximadamente 37 t/s

Esses limites nunca são atingidos, e não temos uma medição a citar para essas placas: o percentual real depende do motor, do contexto e da placa. Mas a proporção de 2 para 1 se mantém. Para IA local, uma RTX 2060 usada é, portanto, mais rápida que uma RTX 3050 de 6 GB nova, apesar da idade, e a nova placa só leva vantagem na eficiência energética e nos recursos recentes. Para as GTX 1660, a variante importa: verifique o modelo exato, pois a memória e o barramento variam conforme o modelo.

#O modelo certo para cada uso com 6 GB

Chat, perguntas, redação
Um modelo de 3 a 4B como Qwen 3.5 4B ou Phi-4 Mini: respostas corretas e rápidas, contexto confortável. Para uma qualidade superior em francês, experimente o 8B em Q4 com um contexto reduzido.
Código
Um pequeno modelo de código de 3 a 7B para autocompletar, um modelo generalista de 4B para explicar. Não espere um agente de código confiável nesse tamanho.
RAG e documentos
Um modelo de 4B e um modelo de embedding leve: tudo cabe na memória. O contexto é o fator limitante: envie trechos curtos.
Visão e áudio
Modelos multimodais leves existem, mas o codificador de imagem consome memória além do modelo: teste com um modelo de 2 a 4B.

Um engano comum: os MoE como Qwen3-Coder 30B-A3B ativam apenas 3 bilhões de parâmetros, o que faz crer que caberiam em 6 GB. Isso não é verdade: todos os especialistas devem estar na memória, e o arquivo pesa 19 GB. A única forma de usá-los é manter os especialistas no processador, o que exige muita memória RAM e custa caro em velocidade. O guia sobre MoE explica o princípio.

#O modo híbrido GPU e processador: útil, mas não mágico

Quando um modelo excede a capacidade de memória da placa, Ollama e llama.cpp podem executar parte das camadas no processador. Isso permite carregar um 9B em uma placa de 6 GB, mas a velocidade cai em patamares: as camadas que ficam na RAM são lidas à velocidade da memória do sistema, uma fração da velocidade da memória da placa. Para os MoE, o llama.cpp oferece uma opção, --n-cpu-moe, que mantém no processador os especialistas de algumas camadas e deixa na placa os componentes usados com mais frequência. Um usuário do repositório llama.cpp relata cerca de 20 tokens por segundo com gpt-oss-20b e todos os especialistas no processador, em uma máquina com DDR4-3200 em dois canais, liberando ao mesmo tempo a maior parte da VRAM.

Este relato mostra que a abordagem funciona, não que ela se adapte à sua máquina. Ela exige 32 GB de memória RAM para um modelo desse tamanho e sua velocidade depende da largura de banda dessa memória. Para uso comum em 6 GB, um modelo de 4B totalmente na placa permanece mais simples e mais rápido.

#Cinco ajustes que importam com 6 GB

  1. 01
    Limitar o contexto
    A FAQ do Ollama indica uma janela padrão de 4.096 tokens, ajustável. Com 6 GB, aumente-a gradualmente (6.000, 8.000) e monitore a memória: cada aumento acrescenta mais cache.
  2. 02
    Quantizar o cache K/V
    Com o Flash Attention ativo, OLLAMA_KV_CACHE_TYPE=q8_0 reduz aproximadamente pela metade a memória do cache em comparação com f16, conforme a FAQ do Ollama. Esse é o primeiro recurso para ganhar margem.
  3. 03
    Fechar o que consome VRAM
    Um navegador com aceleração de hardware, um jogo, um software de edição: cada um consome memória. Com 6 GB, apenas uma tarefa que use a GPU por vez.
  4. 04
    Verificar com o ollama ps
    A coluna Processor indica onde o modelo foi carregado: 100% GPU é o objetivo. Qualquer divisão entre CPU e GPU indica que parte do modelo foi carregada na RAM por falta de espaço na memória da GPU e que a velocidade será menor.
  5. 05
    Escolher a quantização
    Q4_K_M oferece o equilíbrio adequado; em um 4B, você pode subir para Q5 ou Q6 para ganhar em qualidade, já que há margem. O guia de quantização detalha as diferenças.
Configurações para uma placa de 6 GB (definir e depois reiniciar o Ollama)
OLLAMA_FLASH_ATTENTION=1
OLLAMA_KV_CACHE_TYPE=q8_0
OLLAMA_CONTEXT_LENGTH=6144

Essas variáveis são definidas no ambiente do serviço Ollama (systemd no Linux, variáveis de sistema no Windows, launchctl no macOS). O guia de solução de erros de GPU no Ollama detalha o que deve ser verificado quando um modelo não consegue ser carregado na placa.

#Diagnóstico: por que a geração fica lenta em uma placa de 6 GB

Em uma placa de 6 GB, uma queda brusca de desempenho quase sempre tem a mesma origem: parte do modelo ou do cache deixou a memória da placa. A tabela a seguir relaciona o sintoma observado à causa provável e à medida a tentar primeiro.

Sintomas comuns e soluções
SintomaCausa provávelPara experimentar
Respostas fluidas no início, muito lentas após algumas trocas de mensagensO cache de contexto preencheu a VRAM e camadas passam para o processadorReduzir o contexto, quantizar o cache em q8_0, reiniciar a conversa
O modelo carrega, mas ollama ps exibe uma distribuição CPU/GPUO modelo e seu contexto ultrapassam a memória disponívelEscolher um modelo menor ou uma quantização mais leve
Velocidade dividida por dois após abrir um navegador ou um jogoEssas aplicações ocupam VRAMDesativar a aceleração de hardware do navegador, usar a GPU para apenas uma tarefa de cada vez
Mensagem de erro de memória ao carregarO driver reserva memória e o modelo não cabeVerificar o driver, liberar a placa, experimentar um modelo de 4B
Taxa de processamento decepcionante em uma placa recente com barramento estreitoA largura de banda é baixa (RTX 3050 6 GB: barramento de 96 bits)Escolher um modelo menor em vez de esperar uma melhoria no software

Um último ponto sobre a qualidade: quanto menor o modelo, mais erros ele comete em tarefas que exigem conhecimento preciso ou raciocínio longo. Em 6 GB, é melhor usar o modelo para o que ele faz bem (reformular, resumir um texto fornecido, responder com base em trechos que você fornece, classificar, extrair campos) do que para responder de memória a perguntas factuais. Fornecer o texto original na conversa, em vez de confiar no que o modelo "sabe", é a prática que dá os melhores resultados com um modelo pequeno e continua compatível com um contexto curto.

#Passar para 8 ou 12 GB: o que cada nível desbloqueia

O salto mais vantajoso é passar de 6 para 12 GB. Com 12 GB, um modelo de 8-9B em Q4 (5 a 6 GB) cabe com um contexto longo, e um de 14B em Q4 (cerca de 9 GB) torna-se possível. Com 8 GB, um modelo de 8B finalmente cabe com margem, mas um de 14B continua fora de alcance. Não procure preços nesta página: eles mudam toda semana, e o monitoramento do site registra o menor preço para cada placa.

O que cada nível de VRAM permite
VRAMModelos que rodam com folgaO que muda
6 GB3-4B, 8B com contexto curtoUm assistente local razoável
8 GB8B com contexto médioMais margem, Q5 possível
12 GB8-9B com contexto longo, 14B em Q4Mais conforto de verdade para o chat e o RAG
16 GB14B em Q5, 24B em Q3-Q4 no limiteModelos de qualidade superior

#Perguntas frequentes

FAQ
Qual o melhor LLM para 6 GB de VRAM?+
Um modelo de 3 a 4 bilhões de parâmetros em Q4 ou Q5, como o Qwen 3.5 4B (2,3 GB) ou Phi-4 Mini: ele cabe na memória com um contexto confortável. Um 8B em Q4 (Granite 4.2 8B, 4,6 GB) é possível com um contexto muito curto, com o risco de parte da execução passar para o processador.
Qual velocidade esperar com 6 GB de VRAM?+
Depende principalmente da largura de banda da placa: 336 GB/s para uma RTX 2060, 168 GB/s para uma RTX 3050 6 GB. Um modelo de 2,3 GB tem um limite teórico de 146 t/s na primeira e 73 t/s na segunda; os valores reais são mais baixos. Nós não temos medição para citar.
É possível rodar o Qwen 3.5 9B em 6 GB?+
Não de forma completa: pesa aproximadamente 6 GB em Q4 no catálogo QuelLLM, ou seja, ocupa totalmente a placa sem espaço para o cache. Em modo híbrido GPU e processador, ele carrega, mas fica lento. Um modelo de 4B ou 8B com contexto curto é uma melhor escolha.
RTX 2060 6 GB ou RTX 3050 6 GB para IA local?+
A RTX 2060: sua largura de banda de 336 GB/s é o dobro da largura de banda da RTX 3050 6 GB (168 GB/s), e é ela que determina a velocidade de geração. A RTX 3050 6 GB só leva vantagem no consumo de energia e na geração da arquitetura, não na taxa de geração.
6 GB são suficientes para um RAG local?+
Sim para um RAG simples: um modelo de embedding leve e um modelo de 4B cabem juntos na memória. O fator limitante é o comprimento do contexto, que aumenta com a quantidade de trechos enviados ao modelo. Limite-os a alguns trechos curtos e quantize o cache K/V.
Um modelo MoE de 30B pode rodar com 6 GB?+
Apenas mantendo os especialistas no processador, e nesse caso é necessária muita memória RAM: o arquivo do Qwen3-Coder 30B-A3B pesa 19 GB. Apesar de ter 3 bilhões de parâmetros ativos, ele não cabe na placa. É uma opção avançada, não a configuração padrão.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.