Qual LLM na RTX 3060 Ti (8 GB) ?
A RTX 3060 Ti (8 GB, 448 GB/s) executa modelos de 7 a 9 bilhões de parâmetros em Q4 sem precisar transferir parte deles para a RAM do sistema, como Granite 4.2 8B (4,6 GB) ou Qwen 3.5 9B (6 GB). Gera 92 tokens/s no teste de referência do llama.cpp, mais rápido que uma RTX 3060 de 12 GB (75,6), mas seus 8 GB a excluem dos modelos de 12 bilhões de parâmetros. Para a IA local, sua velocidade não compensa os 4 GB faltantes.
A RTX 3060 Ti (dezembro de 2020) é significativamente mais rápida em jogos do que a RTX 3060, mas possui apenas 8 GB de memória. Este guia se baseia em medições públicas recentes para dizer o que ela executa, o que o Flash Attention traz para ela, em que ela se diferencia da 3060 de 12 GB e quando é melhor mudar para outra opção.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Opção de compra para este guia: RTX 5060 Ti 16 GB.
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#RTX 3060 Ti vs RTX 3060: o resumo para a IA local
A RTX 3060 Ti é mais rápida que a 3060 12 GB para gerar texto, mas tem 4 GB a menos, e para IA local é a capacidade que limita. A tabela colaborativa do llama.cpp indica 92,2 tokens por segundo para a 3060 Ti, contra 75,6 para a 3060 12 GB, em um modelo de 7 bilhões de parâmetros em Q4_0: cerca de 22% a mais. Essa vantagem se deve ao seu barramento de 256 bits, que oferece 448 GB/s de largura de banda contra 360 GB/s. Por outro lado, com 8 GB ela roda modelos de 7 a 9 bilhões de parâmetros (Granite 4.2 8B com 4,6 GB, Qwen 3.5 9B com 6 GB), mas não o Gemma 4 12B (7 GB de pesos), que não deixa nenhuma margem para o contexto. Se o seu objetivo é um 8B, a Ti é a mais rápida das duas; se você quer um 12B, ela está fora de jogo.
- RTX 3060 Ti
- Chip GA104, dezembro de 2020, 4 864 núcleos CUDA, 8 GB de GDDR6, barramento de 256 bits, 448 GB/s.
- RTX 3060
- Chip GA106, 3.584 núcleos, 12 GB de GDDR6 em um barramento de 192 bits, 360 GB/s.
- Para um LLM
- Mais largura de banda proporciona mais velocidade; menos memória limita a variedade de modelos que podem ser executados. Os dois efeitos se compensam, mas a capacidade pesa mais.
#Modelos compatíveis com 8 GB
| Modelo | Pesos em Q4 | Peso em Q8 | Com 8 GB |
|---|---|---|---|
| Granite 4.2 8B | 4,6 GB | 9 GB | Q4 cabe com bastante folga; Q8 não cabe |
| Qwen 3.5 9B | 6 GB | 10 GB | Q4 com contexto moderado |
| Gemma 4 12B | 7 GB | 13 GB | Não cabe com contexto |
A taxa de geração da placa não será seu limite: será o espaço. O teste do llama.cpp mostra 7.838 MiB de memória na 3060 Ti, um pouco menos que os 8.192 MiB nominais, e esse orçamento se divide entre os pesos, o cache de contexto e a exibição, se um monitor estiver conectado. Estime no máximo 6 GB de pesos para manter um contexto de milhares de tokens.
#Instalação e configurações
A placa tem capacidade computacional 8.6 na lista do Ollama, que exige um driver 550 ou mais recente. Quanto à fonte de alimentação, a ficha técnica da NVIDIA informa 200 W para a placa e recomenda uma fonte de 600 W para o sistema, contra 550 W para a 3060: uma fonte de 500 W, às vezes citada, fica abaixo dessa recomendação.
- 01Instalar o driverInstale um driver NVIDIA 550 ou mais recente e verifique com nvidia-smi se a placa é reconhecida com aproximadamente 8 GB de memória.
- 02Instalar OllamaSiga o guia de instalação, depois inicie um modelo de 8 bilhões em Q4 com o comando ollama run.
- 03Ativar as configurações de memóriaInicie o servidor com OLLAMA_FLASH_ATTENTION=1 e OLLAMA_KV_CACHE_TYPE=q8_0. A documentação especifica que o cache K/V pode ser quantizado quando o Flash Attention estiver ativado.
- 04Monitorar a memóriaDurante uma longa conversa, observe o nvidia-smi: se a memória se aproximar de 7 800 MiB, reduza o contexto.
#Velocidade: geração, leitura do prompt e Flash Attention
Uma medição de setembro de 2026 publicada no quadro do llama.cpp permite detalhar o comportamento da 3060 Ti, com um modelo de 7 bilhões em Q4_0 de 3,56 GiB. A largura de banda de 448 GB/s permitiria cerca de 117 tokens por segundo no máximo; a medição atinge 92 tokens, ou cerca de 79% do limite. O resultado mais interessante refere-se ao Flash Attention.
| Medição | Sem Flash Attention | Com Flash Attention | Diferença |
|---|---|---|---|
| Geração (128 tokens) | 92,2 tok/s | 96,5 tok/s | +5 % |
| Leitura de um prompt de 4.096 tokens | 1 897 tok/s | 2 598 tok/s | +37 % |
A geração melhora pouco, mas a velocidade de leitura de um prompt longo aumenta em mais de um terço, o que conta para o RAG e os resumos de documentos. Nesse ritmo, um prompt de 10.000 tokens é lido em cerca de quatro segundos, um cálculo teórico que supõe uma taxa de processamento constante. O Ollama ativa o Flash Attention automaticamente quando a placa permite; você pode forçar sua ativação com a variável OLLAMA_FLASH_ATTENTION=1.
Para um modelo mais pesado que o arquivo de teste, a regra de três dá estimativas de ordem de grandeza: 92 × 3,82 ÷ 4,6, ou seja, cerca de 76 tokens por segundo, para Granite 4.2 8B em Q4, e cerca de 59 para Qwen 3.5 9B (6 GB). São limites superiores teóricos, não medições. Se você quiser comparar sua própria placa com esses valores, a ferramenta llama-bench do llama.cpp reproduz o teste: mesmo arquivo Llama 2 7B em Q4_0, todas as camadas colocadas na GPU, com e sem Flash Attention. Os resultados variam conforme o driver, o sistema e o fabricante da placa, mesmo com o mesmo chip; portanto, uma diferença de alguns por cento não é nada anormal. Essas velocidades ultrapassam o ritmo de leitura: a placa nunca é o fator limitante em conversas.
#Documentos e RAG: onde o tempo é gasto
Quando você consulta seus documentos, a placa primeiro passa algum tempo lendo o prompt e depois gera a resposta. Na 3060 Ti, um prompt de 4.096 tokens, equivalente a cerca de dez páginas, é lido em aproximadamente 2,2 segundos sem Flash Attention e 1,6 segundo com Flash Attention, segundo as velocidades medidas pelo llama.cpp. Em seguida, a resposta de 400 tokens leva cerca de quatro a cinco segundos a 92 tokens por segundo no modelo de teste, e mais tempo em um 8B atual. São cálculos teóricos que pressupõem taxas constantes, mas mostram que a espera continua sendo de apenas alguns segundos.
A limitação do RAG em 8 GB, portanto, não é o tempo, é a memória: um contexto de várias dezenas de milhares de tokens satura o cache de contexto de um modelo de 8 bilhões. Duas maneiras de ficar dentro do orçamento de memória: reduzir o número de trechos inseridos no prompt e quantizar o cache K/V em q8_0, que utiliza aproximadamente metade da memória do formato padrão segundo a documentação do Ollama.
#Quando passar para outra coisa
| Sua necessidade | Memória para os pesos | Placa adequada |
|---|---|---|
| Um 8B em Q4 (Granite 4.2 8B) | 4,6 GB | 8 GB são suficientes |
| Um 9B em Q4 com contexto médio (Qwen 3.5 9B) | 6 GB | 8 GB, no limite do confortável |
| Um 8B em Q8 (Granite 4.2 8B) | 9 GB | 12 GB |
| Um 12B em Q4 (Gemma 4 12B) | 7 GB mais o contexto | 12 GB |
| Um 12B em Q8 (Gemma 4 12B) | 13 GB | 16 GB |
Leia essa tabela de cima para baixo: a 3060 Ti atende às duas primeiras linhas e as três seguintes exigem mais memória. Se suas necessidades estão na metade inferior, trocar de placa se justifica; caso contrário, a 3060 Ti faz o trabalho. Um modelo de maior qualidade, mas maior, às vezes vale mais do que uma placa mais rápida: a 92 tokens por segundo, você não está limitado pela velocidade.
#3060 Ti e 3060 de 12 GB: o falso gêmeo
| Critério | RTX 3060 Ti | RTX 3060 12 GB |
|---|---|---|
| Memória | 8 GB | 12 GB |
| Barramento / largura de banda | 256 bits / 448 GB/s | 192 bits / 360 GB/s |
| Geração (7B Q4_0) | 92,2 tok/s | 75,6 tok/s |
| Gemma 4 12B em Q4 (7 GB) | Não cabe na memória com o contexto | Cabe com folga |
| Fonte de alimentação recomendada para o sistema | 600 W | 550 W |
O primeiro impulso é escolher a placa mais rápida. No entanto, nos modelos de 8 a 9 bilhões que as duas placas conseguem carregar, os 22% de velocidade adicional não mudam a experiência: nos dois casos, o texto aparece mais rápido do que conseguimos ler. Por outro lado, a 3060 de 12 GB permite usar uma categoria inteira de modelos. Ela é, portanto, a melhor escolha para a IA local, a menos que seu uso se limite definitivamente aos modelos de 8 a 9B. Uma precaução na compra: a NVIDIA também comercializou uma 3060 Ti com memória GDDR6X, identificável pela ficha técnica; a capacidade de 8 GB permanece a mesma.
#3060 Ti e RTX 4060 Ti 8 GB
A RTX 4060 Ti de 8 GB, sendo mais recente, atinge 63,9 tokens por segundo no mesmo teste, o que é significativamente menor do que a 3060 Ti. A causa é o seu bus de 128 bits, que limita a largura de banda, apesar de uma arquitetura mais eficiente. Para a geração de texto, a 3060 Ti permanece, portanto, mais rápida que essa placa mais recente, com capacidade igual. Seus pontos fortes estão em outros aspectos: as funcionalidades mais recentes da sua arquitetura e, segundo as fichas dos fabricantes, um consumo mais moderado, útil em um gabinete compacto ou em uma máquina que permanece ligada para servir um modelo. Isso, no entanto, não representa um ganho de velocidade na geração de texto, nem um ganho de memória. Se você tiver dúvidas entre as duas, veja a versão de 16 GB da 4060 Ti, que oferece o dobro de memória.
#Veredito 2026
- Mantenha-a se
- Ela funciona e você usa modelos de 7 a 9 bilhões: a velocidade é mais do que suficiente, e não há ganho a esperar de uma troca por outra placa com a mesma capacidade.
- Não compre para usar com IA se uma placa de 12 GB estiver ao seu alcance
- Uma 3060 de 12 GB permite usar modelos de 12 bilhões de parâmetros. A diferença de preço no mercado de usados varia a cada semana: consulte o acompanhamento do site.
- Mude para 12 ou 16 GB se
- Você quer um 12B, um contexto longo ou RAG com documentos volumosos.
#Perguntas frequentes
RTX 3060 Ti ou RTX 3060 de 12 GB para um LLM?+
A RTX 3060 Ti consegue rodar o Gemma 4 12B?+
Quantos tokens por segundo em uma RTX 3060 Ti?+
A RTX 3060 Ti é melhor que a RTX 4060 para um LLM?+
Qual fonte de alimentação usar para uma RTX 3060 Ti?+
O Flash Attention vale a pena em uma RTX 3060 Ti?+
- Fonte: tabela de desempenho do llama.cpp em CUDA
- Fonte: ficha NVIDIA da RTX 3060 e 3060 Ti
- Fonte: placas NVIDIA suportadas pelo Ollama
- Fonte: FAQ do Ollama (Flash Attention, cache K/V)
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.