Iniciante 11 minRTX 30

Qual LLM para RTX 3060 8 GB ?

Resposta direta

A RTX 3060 8 GB executa modelos de 7 a 9 bilhões em Q4, como Granite 4.2 8B (4,6 GB) ou Qwen 3.5 9B (6 GB), mas não os de 12B. Sua particularidade: um barramento de 128 bits e 240 GB/s, contra 192 bits e 360 GB/s na 3060 12 GB, o que a torna significativamente mais lenta na geração. A tabela pública do llama.cpp informa 75,6 tokens/s para a versão de 12 GB em um 7B.

Sob o nome RTX 3060, a NVIDIA vendeu duas placas: a versão original de 12 GB e uma versão de 8 GB lançada no final de 2022, cujo barramento de memória é mais estreito. Este guia explica o que isso muda para a IA local, quais modelos cabem na versão de 8 GB, como não confundir as duas versões na hora da compra e que velocidade esperar, indicando o que é medido e o que não é.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux
Hardware recomendado

Opção de compra para este guia: RTX 5060 Ti 16 GB.

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#RTX 3060 8 GB: o que muda em comparação com a versão de 12 GB

A RTX 3060 de 8 GB roda modelos de 7 a 9 bilhões de parâmetros em Q4: Granite 4.2 8B exige 4,6 GB e Qwen 3.5 9B, 6 GB, segundo o catálogo QuelLLM. Gemma 4 12B (7 GB em Q4) não cabe nela com folga. A diferença em relação à 3060 de 12 GB é dupla: 4 GB a menos e um barramento de 128 bits em vez de 192. Segundo a imprensa especializada que registrou as especificações no lançamento, o barramento mais estreito reduz a largura de banda para 240 GB/s, ou seja, 33% menos que os 360 GB/s da versão de 12 GB. Para a IA local, isso importa: a geração de texto depende principalmente da largura de banda da memória. Não há medição pública para a versão de 8 GB, mas pode-se estimar que ela gere cerca de 50 tokens por segundo em um modelo de 7 bilhões de parâmetros em Q4_0, contra 75,6 medidos na versão de 12 GB.

Chip
A mesma GA106 da 3060 de 12 GB e a mesma potência da placa de 170 W.
Memória
8 GB de GDDR6 em um barramento de 128 bits, ou seja, 240 GB/s, contra 12 GB, 192 bits e 360 GB/s.
Consequência
O mesmo número de núcleos de processamento, mas com capacidade e largura de banda reduzidas: é a memória, não o processamento, que limita a IA local.

#Modelos compatíveis com 8 GB

Modelos para uma RTX 3060 8 GB (peso de acordo com o catálogo QuelLLM)
ModeloPesos em Q4Peso em Q8Com 8 GB
Qwen 3.5 4B2,3 GB4,3 GBQ8 possível, contexto confortável
Granite 4.2 8B4,6 GB9 GBQ4 cabe com folga; Q8 não cabe
Qwen 3.5 9B6 GB10 GBQ4 com contexto moderado
Gemma 4 12B7 GB13 GBNão cabe com contexto

A capacidade é idêntica à de uma 3070 ou de uma 3060 Ti, duas placas de 8 GB mais rápidas. As mesmas regras se aplicam: usar no máximo 6 GB para os pesos, reservar um gigabyte para o driver e o contexto e verificar se o modelo está inteiramente na placa. Para isso, o comando ollama ps exibe 100% GPU quando tudo está carregado na placa. Se aparecer um percentual de CPU, o modelo não está inteiramente na memória da placa, e a velocidade despenca.

#Velocidade: por que o barramento de memória domina

A tabela colaborativa do llama.cpp (Llama 2 7B em Q4_0, arquivo de 3,56 GiB) não inclui a 3060 de 8 GB, mas permite entender o que o barramento de memória muda. Ela apresenta 75,6 tokens por segundo para a 3060 de 12 GB (barramento de 192 bits), 92,2 para a 3060 Ti de 8 GB (256 bits) e 63,9 para uma RTX 4060 Ti de 8 GB cujo barramento é de apenas 128 bits. Com a mesma capacidade, a ordem acompanha a largura do barramento, com algumas nuances: uma placa mais recente com barramento estreito pode ficar atrás de uma mais antiga com barramento largo.

Geração com Llama 2 7B Q4_0: o barramento faz a diferença
PlacaMemóriaBarramentoGeração (tok/s)Status
RTX 3060 Ti8 GB256 bits92,2Medição publicada
RTX 3060 12 GB12 GB192 bits75,6Medição publicada
RTX 4060 Ti 8 GB8 GB128 bits63,9Medição publicada
RTX 3060 8 GB8 GB128 bitscerca de 47 a 50Estimativa, não medida

A estimativa da última linha aplica-se a 240 GB/s o rendimento medido da 12 GB, que atinge cerca de 80 % do que sua largura de banda permite. Trata-se de uma projeção, para ser apresentada assim. Por regra de três com o tamanho dos arquivos, isso dá cerca de 40 tokens por segundo para Granite 4.2 8B (4,6 GB) e uma dezena para Qwen 3.5 9B (6 GB), limites teóricos altos. Este débito permanece legível em discussão, mas coloca a 8 GB aproximadamente um terço abaixo da 12 GB e mais de 40 % abaixo da 3060 Ti.

#Armadilhas a evitar

Duas placas sob um mesmo nome
A NVIDIA lista a RTX 3060 com 12 GB ou 8 GB e um barramento de 192 ou 128 bits. O nome sozinho não diz nada: exija que a capacidade esteja informada no anúncio.
Verificação na instalação
Execute nvidia-smi: a versão de 12 GB exibe aproximadamente 12.287 MiB de acordo com os registros do llama.cpp, a de 8 GB cerca de 7.800 MiB, como sua vizinha a 3060 Ti.
Preço alinhado ao da versão de 12 GB
Alguns vendedores mostram o mesmo preço para as duas versões. Compare com o acompanhamento semanal do site, e não com um preço fixo.
Expectativa irrealista em relação aos modelos de 12B
Gemma 4 12B e modelos desse tamanho não cabem com contexto; o limite é de 9B em Q4.
Ler o nome e a memória total da placa
nvidia-smi --query-gpu=name,memory.total --format=csv

A segunda verificação também se aplica a um PC reaproveitado: a descrição do fabricante ou o nome da placa no Windows nem sempre permitem distinguir as versões, enquanto a memória total informada pelo nvidia-smi não engana.

#O cálculo por trás da estimativa

O princípio é simples: para produzir um token, a placa relê os principais pesos do modelo. A quantidade máxima de tokens por segundo é, portanto, do ordenamento da largura de banda dividida pelo tamanho do arquivo. O arquivo de teste pesa 3,56 GiB, ou seja, cerca de 3,82 GB. Para a 3060 12 GB, 360 GB/s divididos por 3,82 dão um limite de 94 tokens por segundo, e a medição publicada atinge 80%. Para a 8 GB, 240 GB/s dão um limite de cerca de 63 tokens por segundo; aplicando o mesmo rendimento, obtém-se uma cinquantena.

Do limite máximo teórico à estimativa
PlacaLargura de bandaLimite (GB/s ÷ 3,82 GB)Resultado
RTX 3060 12 GB360 GB/scerca de 94 tok/s75,6 tok/s medidos (aproximadamente 80 %)
RTX 3060 8 GB240 GB/scerca de 63 tok/saproximadamente 50 tok/s estimados

Este método tem uma limitação: a eficiência varia de uma placa para outra, como mostram outras placas da mesma tabela cuja razão entre o valor medido e o limite máximo varia de 67% a 85%. Portanto, considere uma faixa, e não um número preciso. Observe também que os resultados publicados dependem do driver, do sistema e do fabricante da placa, mesmo com um chip idêntico, e faça medições no seu próprio equipamento se a velocidade for determinante para uma compra.

#Como isso se traduz na prática

Converta a taxa de geração em tempo de espera. A cerca de 40 tokens por segundo, uma resposta de 500 tokens, ou seja, uma página de explicação, leva cerca de doze segundos; em uma 3060 de 12 GB, a mesma resposta levaria cerca de oito segundos, ainda como estimativa teórica. Para uma conversa, a diferença é tolerável: o texto aparece mais rápido do que você consegue lê-lo. Ela se torna incômoda em dois casos: agentes que encadeiam muitas chamadas ao modelo e o processamento em lote de muitos documentos, em que a diferença se acumula.

A capacidade de 8 GB impõe uma limitação mais clara do que a velocidade. Ela exige que você escolha entre um contexto longo e um modelo maior, enquanto uma placa de 12 GB permite ter os dois. Se o seu uso consiste apenas em fazer perguntas curtas a um modelo de 8B, a opção de 8 GB é suficiente. Se você quer conectar o modelo aos seus documentos, é melhor buscar mais memória.

  1. 01
    Verificar o anúncio
    Procure a indicação de 8 GB ou 12 GB no título, na descrição ou nas fotos da caixa. Se essa informação não estiver especificada, peça ao vendedor que a esclareça.
  2. 02
    Solicitar uma captura
    Exija uma captura de nvidia-smi ou do utilitário GPU-Z mostrando a memória total e a largura do barramento.
  3. 03
    Testar na retirada
    No local, execute nvidia-smi: cerca de 12 287 MiB para a placa de 12 GB e em torno de 7 800 MiB para a de 8 GB.
  4. 04
    Executar um modelo
    Carregue um modelo de 8B em Q4 com o Ollama e verifique com o comando ollama ps se ele está 100% na GPU antes de fechar a compra.

#Contexto: aproveitar os 8 GB

Com 8 GB, o cache de contexto é a verdadeira limitação. A documentação do Ollama indica que o cache K/V pode ser quantizado quando o Flash Attention está ativado: defina OLLAMA_FLASH_ATTENTION=1 e depois OLLAMA_KV_CACHE_TYPE=q8_0 antes de iniciar o servidor. Com um barramento de 128 bits, a placa já tem dificuldades em termos de velocidade; por isso, é melhor não sobrecarregá-la com um contexto excessivo. Um contexto de alguns milhares de tokens com um modelo de 8B em Q4 é um bom equilíbrio.

Linux: iniciar Ollama com cache K/V quantizado
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

#O que escolher no lugar

Alternativas com orçamento semelhante
PlacaMemóriaGeração (tok/s)O que ela oferece
RTX 3060 12 GB12 GB75,6 (medido)Permite executar modelos de 12B e é mais rápida que a versão de 8 GB
RTX 3060 Ti8 GB92,2 (medida)Mesma capacidade, mas muito mais rápida
RTX 4060 Ti 8 GB8 GB63,9 (medida)Mais recente, mas com barramento de 128 bits como a 3060 de 8 GB

A escolha depende da sua necessidade: para capacidade, a 3060 12 GB; para velocidade em modelos de 8 bilhões, a 3060 Ti. Os preços de usados mudam toda semana: o monitoramento do site registra o menor preço das placas para IA local.

#Veredito 2026

Mantenha-a se
Ela já está no seu PC e você pretende usar um modelo de 8 ou 9B em Q4 para conversar ou obter ajuda com programação, sem exigência de velocidade.
Não compre para IA
Uma 3060 de 12 GB traz mais benefícios, especialmente com orçamentos frequentemente próximos. Pague apenas a versão de 8 GB quando estiver bem abaixo do limite.
Verifique sempre a versão
Exija que a capacidade de memória conste no anúncio e confira com nvidia-smi ao receber a placa.

#Perguntas frequentes

Perguntas frequentes
Como diferenciar a RTX 3060 de 8 GB da de 12 GB?+
Verifique a capacidade de memória indicada na embalagem ou no anúncio e depois execute nvidia-smi: a memória total fica próxima de 12 000 MiB na versão de 12 GB (12 287 MiB registrados pelo llama.cpp) e de 8 000 MiB na versão de 8 GB. A NVIDIA também distingue os barramentos: 192 bits na versão de 12 GB, 128 bits na versão de 8 GB.
Quantos tokens por segundo em uma RTX 3060 8 GB?+
Não há medições públicas. A versão de 12 GB gera 75,6 tokens por segundo em um modelo de 7B em Q4_0, segundo a tabela do llama.cpp; com 240 GB/s em vez de 360, a versão de 8 GB deve atingir cerca de 47 a 50 tokens por segundo no mesmo teste, segundo uma estimativa teórica.
RTX 3060 8 GB ou RTX 4060 8 GB para um LLM?+
As duas têm 8 GB e um barramento de 128 bits. A RTX 4060 Ti de 8 GB, outra placa com barramento de 128 bits, registra 63,9 tokens por segundo na tabela pública do llama.cpp. Escolha com base no preço e no consumo: com capacidade e barramento iguais, a velocidade será da mesma ordem de grandeza.
A RTX 3060 8 GB consegue rodar o Gemma 4 12B?+
Com dificuldade. O catálogo indica 7 GB de pesos em Q4, o que deixa apenas um gigabyte para o contexto e o sistema. O modelo é então distribuído entre a placa e a RAM, o que o ollama ps indica, e a velocidade cai. Prefira Qwen 3.5 9B (6 GB) ou Granite 4.2 8B (4,6 GB).
Ollama funciona em uma RTX 3060 8 GB?+
Sim. Ollama lista a RTX 3060 entre as placas com capacidade de computação 8.6 e exige um driver 550 ou mais recente. Após o primeiro carregamento, verifique com ollama ps se aparece a indicação 100% GPU: é o sinal de que o modelo cabe inteiramente nos 8 GB.
É melhor ter uma RTX 3060 de 12 GB?+
Para a IA local, sim em quase todos os casos: ela atinge 75,6 tokens por segundo na tabela pública do llama.cpp, possui 4 GB a mais e permite rodar modelos de 12 bilhões. A versão de 8 GB só vale a pena se já estiver instalada ou for muito mais barata.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.