Qual LLM para 6 GB de VRAM ?
Com 6 GB de VRAM, um modelo de 4 bilhões de parâmetros em Q4 ou Q5 cabe com folga, com um contexto de vários milhares de tokens. Um modelo de 7 a 8 bilhões de parâmetros em Q4 (4,6 a 5,2 GB) ainda pode ser carregado, mas sem margem: o contexto e a memória reservada pelo driver fazem com que parte dele passe a ser executada no processador. Outro ponto que surpreende: nas placas de 6 GB, é a largura de banda da memória, e não a capacidade, que determina a velocidade, e ela pode variar em uma proporção de até dois para um.
6 GB é a faixa de capacidade da GTX 1660, da RTX 2060 e da RTX 3050 6 GB. Essa capacidade é suficiente para um verdadeiro assistente local, desde que você escolha o modelo certo e contabilize também a memória usada além da ocupada pelo modelo. Esta página explica quais modelos cabem, qual placa de 6 GB é mais rápida do que outra, como verificar se um modelo permanece inteiramente na placa e o que mudaria com 12 GB.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Para passar para 16 GB de VRAM: RTX 5060 Ti 16 GB.
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#O que 6 GB permitem: cálculo completo de memória
A VRAM não contém apenas os pesos. Ela também aloca o cache de contexto, que cresce com a conversa, os buffers de cálculo do motor e, no Windows, parte da exibição e do navegador. Em uma placa de 6 GB, pode-se considerar um orçamento de cerca de 5 a 5,5 GB para o modelo e seu cache, o restante sendo ocupado pelo sistema. A referência do site para os pesos em Q4 é 3B ≈ 2 GB, 7-8B ≈ 5 GB.
| Modelo | Pesos Q4 | Margem disponível em 5,5 GB | Veredito |
|---|---|---|---|
| Gemma 4 2B | 1,2 GB | 4,3 GB | Margem muito ampla, respostas curtas e rápidas |
| Qwen 3.5 4B | 2,3 GB | 3,2 GB | Confortável, contexto de milhares de tokens |
| Phi-4 Mini 3.8B | 3 GB | 2,5 GB | Confortável |
| Granite 4.2 8B | 4,6 GB | 0,9 GB | No limite: contexto muito curto |
| Qwen 3 8B (Ollama) | 5,2 GB | 0,3 GB | Excede a memória disponível assim que o contexto aumenta |
| Qwen 3.5 9B | 6 GB | negativa | Não cabe |
Os tamanhos vêm do catálogo QuelLLM e da biblioteca Ollama. A coluna "margem" é uma estimativa: ela pressupõe 5,5 GB utilizáveis, o que depende do seu sistema e dos seus aplicativos. Um modelo de 8B é, portanto, possível no papel, mas deixa menos de um gigabyte para o cache: é o ajuste de contexto que determina se a experiência é fluida ou se as camadas passam a ser executadas no processador.
#Três placas de 6 GB, três velocidades: a largura de banda
A velocidade de geração é limitada pela largura de banda da memória, dividida pelo tamanho dos pesos lidos a cada token. Duas placas de 6 GB não são, portanto, equivalentes. De acordo com a tabela da Wikipédia sobre a geração GeForce 20, a RTX 2060 6 GB oferece 336 GB/s em um barramento de 192 bits. A RTX 3050 6 GB, mais recente, tem apenas um barramento de 96 bits (NVIDIA) e 168 GB/s segundo a mesma enciclopédia: a metade.
| Placa de 6 GB | Largura de banda | Modelo de 2,3 GB (4B Q4) | Modelo de 4,6 GB (8B Q4) |
|---|---|---|---|
| RTX 2060 6 GB | 336 GB/s | cerca de 146 t/s | cerca de 73 t/s |
| RTX 3050 6 GB | 168 GB/s | cerca de 73 t/s | aproximadamente 37 t/s |
Esses limites nunca são atingidos, e não temos uma medição a citar para essas placas: o percentual real depende do motor, do contexto e da placa. Mas a proporção de 2 para 1 se mantém. Para IA local, uma RTX 2060 usada é, portanto, mais rápida que uma RTX 3050 de 6 GB nova, apesar da idade, e a nova placa só leva vantagem na eficiência energética e nos recursos recentes. Para as GTX 1660, a variante importa: verifique o modelo exato, pois a memória e o barramento variam conforme o modelo.
#O modelo certo para cada uso com 6 GB
- Chat, perguntas, redação
- Um modelo de 3 a 4B como Qwen 3.5 4B ou Phi-4 Mini: respostas corretas e rápidas, contexto confortável. Para uma qualidade superior em francês, experimente o 8B em Q4 com um contexto reduzido.
- Código
- Um pequeno modelo de código de 3 a 7B para autocompletar, um modelo generalista de 4B para explicar. Não espere um agente de código confiável nesse tamanho.
- RAG e documentos
- Um modelo de 4B e um modelo de embedding leve: tudo cabe na memória. O contexto é o fator limitante: envie trechos curtos.
- Visão e áudio
- Modelos multimodais leves existem, mas o codificador de imagem consome memória além do modelo: teste com um modelo de 2 a 4B.
Um engano comum: os MoE como Qwen3-Coder 30B-A3B ativam apenas 3 bilhões de parâmetros, o que faz crer que caberiam em 6 GB. Isso não é verdade: todos os especialistas devem estar na memória, e o arquivo pesa 19 GB. A única forma de usá-los é manter os especialistas no processador, o que exige muita memória RAM e custa caro em velocidade. O guia sobre MoE explica o princípio.
#O modo híbrido GPU e processador: útil, mas não mágico
Quando um modelo excede a capacidade de memória da placa, Ollama e llama.cpp podem executar parte das camadas no processador. Isso permite carregar um 9B em uma placa de 6 GB, mas a velocidade cai em patamares: as camadas que ficam na RAM são lidas à velocidade da memória do sistema, uma fração da velocidade da memória da placa. Para os MoE, o llama.cpp oferece uma opção, --n-cpu-moe, que mantém no processador os especialistas de algumas camadas e deixa na placa os componentes usados com mais frequência. Um usuário do repositório llama.cpp relata cerca de 20 tokens por segundo com gpt-oss-20b e todos os especialistas no processador, em uma máquina com DDR4-3200 em dois canais, liberando ao mesmo tempo a maior parte da VRAM.
Este relato mostra que a abordagem funciona, não que ela se adapte à sua máquina. Ela exige 32 GB de memória RAM para um modelo desse tamanho e sua velocidade depende da largura de banda dessa memória. Para uso comum em 6 GB, um modelo de 4B totalmente na placa permanece mais simples e mais rápido.
#Cinco ajustes que importam com 6 GB
- 01Limitar o contextoA FAQ do Ollama indica uma janela padrão de 4.096 tokens, ajustável. Com 6 GB, aumente-a gradualmente (6.000, 8.000) e monitore a memória: cada aumento acrescenta mais cache.
- 02Quantizar o cache K/VCom o Flash Attention ativo, OLLAMA_KV_CACHE_TYPE=q8_0 reduz aproximadamente pela metade a memória do cache em comparação com f16, conforme a FAQ do Ollama. Esse é o primeiro recurso para ganhar margem.
- 03Fechar o que consome VRAMUm navegador com aceleração de hardware, um jogo, um software de edição: cada um consome memória. Com 6 GB, apenas uma tarefa que use a GPU por vez.
- 04Verificar com o ollama psA coluna Processor indica onde o modelo foi carregado: 100% GPU é o objetivo. Qualquer divisão entre CPU e GPU indica que parte do modelo foi carregada na RAM por falta de espaço na memória da GPU e que a velocidade será menor.
- 05Escolher a quantizaçãoQ4_K_M oferece o equilíbrio adequado; em um 4B, você pode subir para Q5 ou Q6 para ganhar em qualidade, já que há margem. O guia de quantização detalha as diferenças.
Essas variáveis são definidas no ambiente do serviço Ollama (systemd no Linux, variáveis de sistema no Windows, launchctl no macOS). O guia de solução de erros de GPU no Ollama detalha o que deve ser verificado quando um modelo não consegue ser carregado na placa.
#Diagnóstico: por que a geração fica lenta em uma placa de 6 GB
Em uma placa de 6 GB, uma queda brusca de desempenho quase sempre tem a mesma origem: parte do modelo ou do cache deixou a memória da placa. A tabela a seguir relaciona o sintoma observado à causa provável e à medida a tentar primeiro.
| Sintoma | Causa provável | Para experimentar |
|---|---|---|
| Respostas fluidas no início, muito lentas após algumas trocas de mensagens | O cache de contexto preencheu a VRAM e camadas passam para o processador | Reduzir o contexto, quantizar o cache em q8_0, reiniciar a conversa |
| O modelo carrega, mas ollama ps exibe uma distribuição CPU/GPU | O modelo e seu contexto ultrapassam a memória disponível | Escolher um modelo menor ou uma quantização mais leve |
| Velocidade dividida por dois após abrir um navegador ou um jogo | Essas aplicações ocupam VRAM | Desativar a aceleração de hardware do navegador, usar a GPU para apenas uma tarefa de cada vez |
| Mensagem de erro de memória ao carregar | O driver reserva memória e o modelo não cabe | Verificar o driver, liberar a placa, experimentar um modelo de 4B |
| Taxa de processamento decepcionante em uma placa recente com barramento estreito | A largura de banda é baixa (RTX 3050 6 GB: barramento de 96 bits) | Escolher um modelo menor em vez de esperar uma melhoria no software |
Um último ponto sobre a qualidade: quanto menor o modelo, mais erros ele comete em tarefas que exigem conhecimento preciso ou raciocínio longo. Em 6 GB, é melhor usar o modelo para o que ele faz bem (reformular, resumir um texto fornecido, responder com base em trechos que você fornece, classificar, extrair campos) do que para responder de memória a perguntas factuais. Fornecer o texto original na conversa, em vez de confiar no que o modelo "sabe", é a prática que dá os melhores resultados com um modelo pequeno e continua compatível com um contexto curto.
#Passar para 8 ou 12 GB: o que cada nível desbloqueia
O salto mais vantajoso é passar de 6 para 12 GB. Com 12 GB, um modelo de 8-9B em Q4 (5 a 6 GB) cabe com um contexto longo, e um de 14B em Q4 (cerca de 9 GB) torna-se possível. Com 8 GB, um modelo de 8B finalmente cabe com margem, mas um de 14B continua fora de alcance. Não procure preços nesta página: eles mudam toda semana, e o monitoramento do site registra o menor preço para cada placa.
| VRAM | Modelos que rodam com folga | O que muda |
|---|---|---|
| 6 GB | 3-4B, 8B com contexto curto | Um assistente local razoável |
| 8 GB | 8B com contexto médio | Mais margem, Q5 possível |
| 12 GB | 8-9B com contexto longo, 14B em Q4 | Mais conforto de verdade para o chat e o RAG |
| 16 GB | 14B em Q5, 24B em Q3-Q4 no limite | Modelos de qualidade superior |
- Acompanhamento dos preços das placas de vídeo para IA local
- Qual LLM para 8 GB de VRAM
- Qual LLM para 12 GB de VRAM
- Fonte: biblioteca Ollama, Qwen3
- Fonte: FAQ oficial do Ollama
- Fonte: discussão no llama.cpp sobre gpt-oss e --n-cpu-moe
#Perguntas frequentes
Qual o melhor LLM para 6 GB de VRAM?+
Qual velocidade esperar com 6 GB de VRAM?+
É possível rodar o Qwen 3.5 9B em 6 GB?+
RTX 2060 6 GB ou RTX 3050 6 GB para IA local?+
6 GB são suficientes para um RAG local?+
Um modelo MoE de 30B pode rodar com 6 GB?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.