Qual LLM para RTX 3060 8 GB ?
A RTX 3060 8 GB executa modelos de 7 a 9 bilhões em Q4, como Granite 4.2 8B (4,6 GB) ou Qwen 3.5 9B (6 GB), mas não os de 12B. Sua particularidade: um barramento de 128 bits e 240 GB/s, contra 192 bits e 360 GB/s na 3060 12 GB, o que a torna significativamente mais lenta na geração. A tabela pública do llama.cpp informa 75,6 tokens/s para a versão de 12 GB em um 7B.
Sob o nome RTX 3060, a NVIDIA vendeu duas placas: a versão original de 12 GB e uma versão de 8 GB lançada no final de 2022, cujo barramento de memória é mais estreito. Este guia explica o que isso muda para a IA local, quais modelos cabem na versão de 8 GB, como não confundir as duas versões na hora da compra e que velocidade esperar, indicando o que é medido e o que não é.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Opção de compra para este guia: RTX 5060 Ti 16 GB.
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#RTX 3060 8 GB: o que muda em comparação com a versão de 12 GB
A RTX 3060 de 8 GB roda modelos de 7 a 9 bilhões de parâmetros em Q4: Granite 4.2 8B exige 4,6 GB e Qwen 3.5 9B, 6 GB, segundo o catálogo QuelLLM. Gemma 4 12B (7 GB em Q4) não cabe nela com folga. A diferença em relação à 3060 de 12 GB é dupla: 4 GB a menos e um barramento de 128 bits em vez de 192. Segundo a imprensa especializada que registrou as especificações no lançamento, o barramento mais estreito reduz a largura de banda para 240 GB/s, ou seja, 33% menos que os 360 GB/s da versão de 12 GB. Para a IA local, isso importa: a geração de texto depende principalmente da largura de banda da memória. Não há medição pública para a versão de 8 GB, mas pode-se estimar que ela gere cerca de 50 tokens por segundo em um modelo de 7 bilhões de parâmetros em Q4_0, contra 75,6 medidos na versão de 12 GB.
- Chip
- A mesma GA106 da 3060 de 12 GB e a mesma potência da placa de 170 W.
- Memória
- 8 GB de GDDR6 em um barramento de 128 bits, ou seja, 240 GB/s, contra 12 GB, 192 bits e 360 GB/s.
- Consequência
- O mesmo número de núcleos de processamento, mas com capacidade e largura de banda reduzidas: é a memória, não o processamento, que limita a IA local.
#Modelos compatíveis com 8 GB
| Modelo | Pesos em Q4 | Peso em Q8 | Com 8 GB |
|---|---|---|---|
| Qwen 3.5 4B | 2,3 GB | 4,3 GB | Q8 possível, contexto confortável |
| Granite 4.2 8B | 4,6 GB | 9 GB | Q4 cabe com folga; Q8 não cabe |
| Qwen 3.5 9B | 6 GB | 10 GB | Q4 com contexto moderado |
| Gemma 4 12B | 7 GB | 13 GB | Não cabe com contexto |
A capacidade é idêntica à de uma 3070 ou de uma 3060 Ti, duas placas de 8 GB mais rápidas. As mesmas regras se aplicam: usar no máximo 6 GB para os pesos, reservar um gigabyte para o driver e o contexto e verificar se o modelo está inteiramente na placa. Para isso, o comando ollama ps exibe 100% GPU quando tudo está carregado na placa. Se aparecer um percentual de CPU, o modelo não está inteiramente na memória da placa, e a velocidade despenca.
#Velocidade: por que o barramento de memória domina
A tabela colaborativa do llama.cpp (Llama 2 7B em Q4_0, arquivo de 3,56 GiB) não inclui a 3060 de 8 GB, mas permite entender o que o barramento de memória muda. Ela apresenta 75,6 tokens por segundo para a 3060 de 12 GB (barramento de 192 bits), 92,2 para a 3060 Ti de 8 GB (256 bits) e 63,9 para uma RTX 4060 Ti de 8 GB cujo barramento é de apenas 128 bits. Com a mesma capacidade, a ordem acompanha a largura do barramento, com algumas nuances: uma placa mais recente com barramento estreito pode ficar atrás de uma mais antiga com barramento largo.
| Placa | Memória | Barramento | Geração (tok/s) | Status |
|---|---|---|---|---|
| RTX 3060 Ti | 8 GB | 256 bits | 92,2 | Medição publicada |
| RTX 3060 12 GB | 12 GB | 192 bits | 75,6 | Medição publicada |
| RTX 4060 Ti 8 GB | 8 GB | 128 bits | 63,9 | Medição publicada |
| RTX 3060 8 GB | 8 GB | 128 bits | cerca de 47 a 50 | Estimativa, não medida |
A estimativa da última linha aplica-se a 240 GB/s o rendimento medido da 12 GB, que atinge cerca de 80 % do que sua largura de banda permite. Trata-se de uma projeção, para ser apresentada assim. Por regra de três com o tamanho dos arquivos, isso dá cerca de 40 tokens por segundo para Granite 4.2 8B (4,6 GB) e uma dezena para Qwen 3.5 9B (6 GB), limites teóricos altos. Este débito permanece legível em discussão, mas coloca a 8 GB aproximadamente um terço abaixo da 12 GB e mais de 40 % abaixo da 3060 Ti.
#Armadilhas a evitar
- Duas placas sob um mesmo nome
- A NVIDIA lista a RTX 3060 com 12 GB ou 8 GB e um barramento de 192 ou 128 bits. O nome sozinho não diz nada: exija que a capacidade esteja informada no anúncio.
- Verificação na instalação
- Execute nvidia-smi: a versão de 12 GB exibe aproximadamente 12.287 MiB de acordo com os registros do llama.cpp, a de 8 GB cerca de 7.800 MiB, como sua vizinha a 3060 Ti.
- Preço alinhado ao da versão de 12 GB
- Alguns vendedores mostram o mesmo preço para as duas versões. Compare com o acompanhamento semanal do site, e não com um preço fixo.
- Expectativa irrealista em relação aos modelos de 12B
- Gemma 4 12B e modelos desse tamanho não cabem com contexto; o limite é de 9B em Q4.
A segunda verificação também se aplica a um PC reaproveitado: a descrição do fabricante ou o nome da placa no Windows nem sempre permitem distinguir as versões, enquanto a memória total informada pelo nvidia-smi não engana.
#O cálculo por trás da estimativa
O princípio é simples: para produzir um token, a placa relê os principais pesos do modelo. A quantidade máxima de tokens por segundo é, portanto, do ordenamento da largura de banda dividida pelo tamanho do arquivo. O arquivo de teste pesa 3,56 GiB, ou seja, cerca de 3,82 GB. Para a 3060 12 GB, 360 GB/s divididos por 3,82 dão um limite de 94 tokens por segundo, e a medição publicada atinge 80%. Para a 8 GB, 240 GB/s dão um limite de cerca de 63 tokens por segundo; aplicando o mesmo rendimento, obtém-se uma cinquantena.
| Placa | Largura de banda | Limite (GB/s ÷ 3,82 GB) | Resultado |
|---|---|---|---|
| RTX 3060 12 GB | 360 GB/s | cerca de 94 tok/s | 75,6 tok/s medidos (aproximadamente 80 %) |
| RTX 3060 8 GB | 240 GB/s | cerca de 63 tok/s | aproximadamente 50 tok/s estimados |
Este método tem uma limitação: a eficiência varia de uma placa para outra, como mostram outras placas da mesma tabela cuja razão entre o valor medido e o limite máximo varia de 67% a 85%. Portanto, considere uma faixa, e não um número preciso. Observe também que os resultados publicados dependem do driver, do sistema e do fabricante da placa, mesmo com um chip idêntico, e faça medições no seu próprio equipamento se a velocidade for determinante para uma compra.
#Como isso se traduz na prática
Converta a taxa de geração em tempo de espera. A cerca de 40 tokens por segundo, uma resposta de 500 tokens, ou seja, uma página de explicação, leva cerca de doze segundos; em uma 3060 de 12 GB, a mesma resposta levaria cerca de oito segundos, ainda como estimativa teórica. Para uma conversa, a diferença é tolerável: o texto aparece mais rápido do que você consegue lê-lo. Ela se torna incômoda em dois casos: agentes que encadeiam muitas chamadas ao modelo e o processamento em lote de muitos documentos, em que a diferença se acumula.
A capacidade de 8 GB impõe uma limitação mais clara do que a velocidade. Ela exige que você escolha entre um contexto longo e um modelo maior, enquanto uma placa de 12 GB permite ter os dois. Se o seu uso consiste apenas em fazer perguntas curtas a um modelo de 8B, a opção de 8 GB é suficiente. Se você quer conectar o modelo aos seus documentos, é melhor buscar mais memória.
- 01Verificar o anúncioProcure a indicação de 8 GB ou 12 GB no título, na descrição ou nas fotos da caixa. Se essa informação não estiver especificada, peça ao vendedor que a esclareça.
- 02Solicitar uma capturaExija uma captura de nvidia-smi ou do utilitário GPU-Z mostrando a memória total e a largura do barramento.
- 03Testar na retiradaNo local, execute nvidia-smi: cerca de 12 287 MiB para a placa de 12 GB e em torno de 7 800 MiB para a de 8 GB.
- 04Executar um modeloCarregue um modelo de 8B em Q4 com o Ollama e verifique com o comando ollama ps se ele está 100% na GPU antes de fechar a compra.
#Contexto: aproveitar os 8 GB
Com 8 GB, o cache de contexto é a verdadeira limitação. A documentação do Ollama indica que o cache K/V pode ser quantizado quando o Flash Attention está ativado: defina OLLAMA_FLASH_ATTENTION=1 e depois OLLAMA_KV_CACHE_TYPE=q8_0 antes de iniciar o servidor. Com um barramento de 128 bits, a placa já tem dificuldades em termos de velocidade; por isso, é melhor não sobrecarregá-la com um contexto excessivo. Um contexto de alguns milhares de tokens com um modelo de 8B em Q4 é um bom equilíbrio.
#O que escolher no lugar
| Placa | Memória | Geração (tok/s) | O que ela oferece |
|---|---|---|---|
| RTX 3060 12 GB | 12 GB | 75,6 (medido) | Permite executar modelos de 12B e é mais rápida que a versão de 8 GB |
| RTX 3060 Ti | 8 GB | 92,2 (medida) | Mesma capacidade, mas muito mais rápida |
| RTX 4060 Ti 8 GB | 8 GB | 63,9 (medida) | Mais recente, mas com barramento de 128 bits como a 3060 de 8 GB |
A escolha depende da sua necessidade: para capacidade, a 3060 12 GB; para velocidade em modelos de 8 bilhões, a 3060 Ti. Os preços de usados mudam toda semana: o monitoramento do site registra o menor preço das placas para IA local.
- Preços de placas de vídeo para IA local (acompanhamento semanal)
- Qual LLM para RTX 3060 12 GB?
- Qual LLM para RTX 3060 Ti (8 GB)?
#Veredito 2026
- Mantenha-a se
- Ela já está no seu PC e você pretende usar um modelo de 8 ou 9B em Q4 para conversar ou obter ajuda com programação, sem exigência de velocidade.
- Não compre para IA
- Uma 3060 de 12 GB traz mais benefícios, especialmente com orçamentos frequentemente próximos. Pague apenas a versão de 8 GB quando estiver bem abaixo do limite.
- Verifique sempre a versão
- Exija que a capacidade de memória conste no anúncio e confira com nvidia-smi ao receber a placa.
#Perguntas frequentes
Como diferenciar a RTX 3060 de 8 GB da de 12 GB?+
Quantos tokens por segundo em uma RTX 3060 8 GB?+
RTX 3060 8 GB ou RTX 4060 8 GB para um LLM?+
A RTX 3060 8 GB consegue rodar o Gemma 4 12B?+
Ollama funciona em uma RTX 3060 8 GB?+
É melhor ter uma RTX 3060 de 12 GB?+
- Fonte: tabela de desempenho do llama.cpp em CUDA
- Fonte: ficha da NVIDIA sobre a RTX 3060
- Fonte: Tom's Hardware, RTX 3060 8 GB
- Fonte: FAQ do Ollama (ollama ps, cache K/V)
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.