Iniciante 11 minRTX 30

Qual LLM na RTX 3060 Ti (8 GB) ?

Resposta direta

A RTX 3060 Ti (8 GB, 448 GB/s) executa modelos de 7 a 9 bilhões de parâmetros em Q4 sem precisar transferir parte deles para a RAM do sistema, como Granite 4.2 8B (4,6 GB) ou Qwen 3.5 9B (6 GB). Gera 92 tokens/s no teste de referência do llama.cpp, mais rápido que uma RTX 3060 de 12 GB (75,6), mas seus 8 GB a excluem dos modelos de 12 bilhões de parâmetros. Para a IA local, sua velocidade não compensa os 4 GB faltantes.

A RTX 3060 Ti (dezembro de 2020) é significativamente mais rápida em jogos do que a RTX 3060, mas possui apenas 8 GB de memória. Este guia se baseia em medições públicas recentes para dizer o que ela executa, o que o Flash Attention traz para ela, em que ela se diferencia da 3060 de 12 GB e quando é melhor mudar para outra opção.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux
Hardware recomendado

Opção de compra para este guia: RTX 5060 Ti 16 GB.

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#RTX 3060 Ti vs RTX 3060: o resumo para a IA local

A RTX 3060 Ti é mais rápida que a 3060 12 GB para gerar texto, mas tem 4 GB a menos, e para IA local é a capacidade que limita. A tabela colaborativa do llama.cpp indica 92,2 tokens por segundo para a 3060 Ti, contra 75,6 para a 3060 12 GB, em um modelo de 7 bilhões de parâmetros em Q4_0: cerca de 22% a mais. Essa vantagem se deve ao seu barramento de 256 bits, que oferece 448 GB/s de largura de banda contra 360 GB/s. Por outro lado, com 8 GB ela roda modelos de 7 a 9 bilhões de parâmetros (Granite 4.2 8B com 4,6 GB, Qwen 3.5 9B com 6 GB), mas não o Gemma 4 12B (7 GB de pesos), que não deixa nenhuma margem para o contexto. Se o seu objetivo é um 8B, a Ti é a mais rápida das duas; se você quer um 12B, ela está fora de jogo.

RTX 3060 Ti
Chip GA104, dezembro de 2020, 4 864 núcleos CUDA, 8 GB de GDDR6, barramento de 256 bits, 448 GB/s.
RTX 3060
Chip GA106, 3.584 núcleos, 12 GB de GDDR6 em um barramento de 192 bits, 360 GB/s.
Para um LLM
Mais largura de banda proporciona mais velocidade; menos memória limita a variedade de modelos que podem ser executados. Os dois efeitos se compensam, mas a capacidade pesa mais.

#Modelos compatíveis com 8 GB

Modelos para uma RTX 3060 Ti (peso de acordo com o catálogo QuelLLM)
ModeloPesos em Q4Peso em Q8Com 8 GB
Granite 4.2 8B4,6 GB9 GBQ4 cabe com bastante folga; Q8 não cabe
Qwen 3.5 9B6 GB10 GBQ4 com contexto moderado
Gemma 4 12B7 GB13 GBNão cabe com contexto

A taxa de geração da placa não será seu limite: será o espaço. O teste do llama.cpp mostra 7.838 MiB de memória na 3060 Ti, um pouco menos que os 8.192 MiB nominais, e esse orçamento se divide entre os pesos, o cache de contexto e a exibição, se um monitor estiver conectado. Estime no máximo 6 GB de pesos para manter um contexto de milhares de tokens.

#Instalação e configurações

A placa tem capacidade computacional 8.6 na lista do Ollama, que exige um driver 550 ou mais recente. Quanto à fonte de alimentação, a ficha técnica da NVIDIA informa 200 W para a placa e recomenda uma fonte de 600 W para o sistema, contra 550 W para a 3060: uma fonte de 500 W, às vezes citada, fica abaixo dessa recomendação.

  1. 01
    Instalar o driver
    Instale um driver NVIDIA 550 ou mais recente e verifique com nvidia-smi se a placa é reconhecida com aproximadamente 8 GB de memória.
  2. 02
    Instalar Ollama
    Siga o guia de instalação, depois inicie um modelo de 8 bilhões em Q4 com o comando ollama run.
  3. 03
    Ativar as configurações de memória
    Inicie o servidor com OLLAMA_FLASH_ATTENTION=1 e OLLAMA_KV_CACHE_TYPE=q8_0. A documentação especifica que o cache K/V pode ser quantizado quando o Flash Attention estiver ativado.
  4. 04
    Monitorar a memória
    Durante uma longa conversa, observe o nvidia-smi: se a memória se aproximar de 7 800 MiB, reduza o contexto.
Linux: iniciar Ollama com configurações de memória
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

#Velocidade: geração, leitura do prompt e Flash Attention

Uma medição de setembro de 2026 publicada no quadro do llama.cpp permite detalhar o comportamento da 3060 Ti, com um modelo de 7 bilhões em Q4_0 de 3,56 GiB. A largura de banda de 448 GB/s permitiria cerca de 117 tokens por segundo no máximo; a medição atinge 92 tokens, ou cerca de 79% do limite. O resultado mais interessante refere-se ao Flash Attention.

RTX 3060 Ti, Llama 2 7B Q4_0, efeito de Flash Attention
MediçãoSem Flash AttentionCom Flash AttentionDiferença
Geração (128 tokens)92,2 tok/s96,5 tok/s+5 %
Leitura de um prompt de 4.096 tokens1 897 tok/s2 598 tok/s+37 %

A geração melhora pouco, mas a velocidade de leitura de um prompt longo aumenta em mais de um terço, o que conta para o RAG e os resumos de documentos. Nesse ritmo, um prompt de 10.000 tokens é lido em cerca de quatro segundos, um cálculo teórico que supõe uma taxa de processamento constante. O Ollama ativa o Flash Attention automaticamente quando a placa permite; você pode forçar sua ativação com a variável OLLAMA_FLASH_ATTENTION=1.

Para um modelo mais pesado que o arquivo de teste, a regra de três dá estimativas de ordem de grandeza: 92 × 3,82 ÷ 4,6, ou seja, cerca de 76 tokens por segundo, para Granite 4.2 8B em Q4, e cerca de 59 para Qwen 3.5 9B (6 GB). São limites superiores teóricos, não medições. Se você quiser comparar sua própria placa com esses valores, a ferramenta llama-bench do llama.cpp reproduz o teste: mesmo arquivo Llama 2 7B em Q4_0, todas as camadas colocadas na GPU, com e sem Flash Attention. Os resultados variam conforme o driver, o sistema e o fabricante da placa, mesmo com o mesmo chip; portanto, uma diferença de alguns por cento não é nada anormal. Essas velocidades ultrapassam o ritmo de leitura: a placa nunca é o fator limitante em conversas.

#Documentos e RAG: onde o tempo é gasto

Quando você consulta seus documentos, a placa primeiro passa algum tempo lendo o prompt e depois gera a resposta. Na 3060 Ti, um prompt de 4.096 tokens, equivalente a cerca de dez páginas, é lido em aproximadamente 2,2 segundos sem Flash Attention e 1,6 segundo com Flash Attention, segundo as velocidades medidas pelo llama.cpp. Em seguida, a resposta de 400 tokens leva cerca de quatro a cinco segundos a 92 tokens por segundo no modelo de teste, e mais tempo em um 8B atual. São cálculos teóricos que pressupõem taxas constantes, mas mostram que a espera continua sendo de apenas alguns segundos.

A limitação do RAG em 8 GB, portanto, não é o tempo, é a memória: um contexto de várias dezenas de milhares de tokens satura o cache de contexto de um modelo de 8 bilhões. Duas maneiras de ficar dentro do orçamento de memória: reduzir o número de trechos inseridos no prompt e quantizar o cache K/V em q8_0, que utiliza aproximadamente metade da memória do formato padrão segundo a documentação do Ollama.

#Quando passar para outra coisa

O que cada necessidade exige (pesos conforme o catálogo QuelLLM)
Sua necessidadeMemória para os pesosPlaca adequada
Um 8B em Q4 (Granite 4.2 8B)4,6 GB8 GB são suficientes
Um 9B em Q4 com contexto médio (Qwen 3.5 9B)6 GB8 GB, no limite do confortável
Um 8B em Q8 (Granite 4.2 8B)9 GB12 GB
Um 12B em Q4 (Gemma 4 12B)7 GB mais o contexto12 GB
Um 12B em Q8 (Gemma 4 12B)13 GB16 GB

Leia essa tabela de cima para baixo: a 3060 Ti atende às duas primeiras linhas e as três seguintes exigem mais memória. Se suas necessidades estão na metade inferior, trocar de placa se justifica; caso contrário, a 3060 Ti faz o trabalho. Um modelo de maior qualidade, mas maior, às vezes vale mais do que uma placa mais rápida: a 92 tokens por segundo, você não está limitado pela velocidade.

#3060 Ti e 3060 de 12 GB: o falso gêmeo

3060 Ti ou 3060 de 12 GB para um LLM
CritérioRTX 3060 TiRTX 3060 12 GB
Memória8 GB12 GB
Barramento / largura de banda256 bits / 448 GB/s192 bits / 360 GB/s
Geração (7B Q4_0)92,2 tok/s75,6 tok/s
Gemma 4 12B em Q4 (7 GB)Não cabe na memória com o contextoCabe com folga
Fonte de alimentação recomendada para o sistema600 W550 W

O primeiro impulso é escolher a placa mais rápida. No entanto, nos modelos de 8 a 9 bilhões que as duas placas conseguem carregar, os 22% de velocidade adicional não mudam a experiência: nos dois casos, o texto aparece mais rápido do que conseguimos ler. Por outro lado, a 3060 de 12 GB permite usar uma categoria inteira de modelos. Ela é, portanto, a melhor escolha para a IA local, a menos que seu uso se limite definitivamente aos modelos de 8 a 9B. Uma precaução na compra: a NVIDIA também comercializou uma 3060 Ti com memória GDDR6X, identificável pela ficha técnica; a capacidade de 8 GB permanece a mesma.

#3060 Ti e RTX 4060 Ti 8 GB

A RTX 4060 Ti de 8 GB, sendo mais recente, atinge 63,9 tokens por segundo no mesmo teste, o que é significativamente menor do que a 3060 Ti. A causa é o seu bus de 128 bits, que limita a largura de banda, apesar de uma arquitetura mais eficiente. Para a geração de texto, a 3060 Ti permanece, portanto, mais rápida que essa placa mais recente, com capacidade igual. Seus pontos fortes estão em outros aspectos: as funcionalidades mais recentes da sua arquitetura e, segundo as fichas dos fabricantes, um consumo mais moderado, útil em um gabinete compacto ou em uma máquina que permanece ligada para servir um modelo. Isso, no entanto, não representa um ganho de velocidade na geração de texto, nem um ganho de memória. Se você tiver dúvidas entre as duas, veja a versão de 16 GB da 4060 Ti, que oferece o dobro de memória.

#Veredito 2026

Mantenha-a se
Ela funciona e você usa modelos de 7 a 9 bilhões: a velocidade é mais do que suficiente, e não há ganho a esperar de uma troca por outra placa com a mesma capacidade.
Não compre para usar com IA se uma placa de 12 GB estiver ao seu alcance
Uma 3060 de 12 GB permite usar modelos de 12 bilhões de parâmetros. A diferença de preço no mercado de usados varia a cada semana: consulte o acompanhamento do site.
Mude para 12 ou 16 GB se
Você quer um 12B, um contexto longo ou RAG com documentos volumosos.

#Perguntas frequentes

Perguntas frequentes
RTX 3060 Ti ou RTX 3060 de 12 GB para um LLM?+
A 3060 de 12 GB para IA local, apesar de sua velocidade inferior: 75,6 tokens por segundo contra 92,2 da Ti no teste do llama.cpp, mas com 4 GB a mais de memória. Esses 4 GB permitem carregar modelos de 12 bilhões como Gemma 4 12B, que a 3060 Ti não consegue carregar com contexto.
A RTX 3060 Ti consegue rodar o Gemma 4 12B?+
Não com folga. O catálogo indica 7 GB para os pesos em Q4, enquanto o llama.cpp identifica apenas 7.838 MiB na placa, antes mesmo de considerar o cache de contexto e a memória usada para a exibição. O modelo excede a capacidade da VRAM assim que a conversa se alonga. Fique com Granite 4.2 8B (4,6 GB) ou Qwen 3.5 9B (6 GB).
Quantos tokens por segundo em uma RTX 3060 Ti?+
92,2 tokens por segundo na geração, e 96,5 com Flash Attention, no Llama 2 7B em Q4_0, segundo a tabela pública do llama.cpp. Um modelo mais pesado será mais lento, com uma redução de velocidade aproximadamente proporcional ao seu tamanho: conte com algo em torno de 60 a 75 tokens por segundo para um modelo 8B ou 9B em Q4, como estimativa teórica.
A RTX 3060 Ti é melhor que a RTX 4060 para um LLM?+
Com a mesma memória de 8 GB, a 3060 Ti gera mais rápido: 92,2 tokens por segundo, contra 63,9 para a RTX 4060 Ti 8 GB, cujo barramento é de apenas 128 bits. A 4060 consome menos e oferece funcionalidades mais recentes, mas não há ganho de velocidade na geração de texto.
Qual fonte de alimentação usar para uma RTX 3060 Ti?+
A NVIDIA anuncia 200 W para a placa e recomenda uma fonte de alimentação de 600 W para o sistema, contra 550 W para a RTX 3060. Uma fonte de 500 W está, portanto, abaixo da recomendação do fabricante: prefira uma de 600 W de boa qualidade, especialmente se seu processador consumir muita energia.
O Flash Attention vale a pena em uma RTX 3060 Ti?+
Sim, principalmente para prompts longos: a tabela do llama.cpp mede a leitura de 4.096 tokens a 2.598 tokens por segundo com Flash Attention contra 1.897 sem, ou seja, 37% a mais. A geração melhora em torno de 5%. O Ollama ativa o Flash Attention automaticamente quando a placa permite.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.