Qual LLM usar na RTX 2060 / 2060 Super (6-8 GB) ?
Sim, uma RTX 2060 roda um LLM local: com 6 GB, um modelo de 3 a 4 bilhões de parâmetros em Q4 cabe com folga; com 8 GB (2060 Super), um modelo de 8B em Q4 (4,6 a 5,2 GB) cabe com um contexto moderado; a variante de 12 GB do final de 2021 comporta um modelo de 14B. Lançada em janeiro de 2019, a 2060 continua sendo suportada pelo Ollama e pelo CUDA. Sua verdadeira limitação é a memória, não a idade.
Existem três placas com esse nome: a RTX 2060 de janeiro de 2019 (6 GB), a 2060 Super de julho de 2019 (8 GB) e uma 2060 de dezembro de 2021 com 12 GB. Para a IA local, elas estão longe de ser equivalentes. Esta página apresenta as características de cada uma, o que elas conseguem rodar hoje, o que o cálculo de velocidade indica e quando passar para outra opção.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Opção de compra para este guia: RTX 5060 Ti 16 GB.
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#RTX 2060, 2060 Super, 2060 12 GB: três placas, três usos
A RTX 2060 foi lançada em 15 de janeiro de 2019, a 2060 Super em 9 de julho de 2019 e uma variante da 2060 com 12 GB em 7 de dezembro de 2021, de acordo com a tabela das GeForce série 20 da Wikipédia. Todas são baseadas no chip Turing TU106. Para um LLM, o que importa é a memória (capacidade, barramento, largura de banda), mais do que os núcleos CUDA.
| Placa | Data de lançamento | Núcleos CUDA | Memória | Largura de banda | Potência |
|---|---|---|---|---|---|
| RTX 2060 | 15 de janeiro de 2019 | 1 920 | 6 GB, barramento de 192 bits | 336 GB/s | 160 W |
| RTX 2060 Super | 9 de julho de 2019 | 2 176 | 8 GB, barramento de 256 bits | 448 GB/s | 175 W |
| RTX 2060 12 GB | 7 de dezembro de 2021 | 2 176 | 12 GB | não especificada nesta tabela | 185 W |
A 2060 Super oferece 448 GB/s de largura de banda contra 336 GB/s da 2060 original: com o mesmo modelo, ela gera cerca de um terço mais rápido. A variante de 12 GB é rara e chegou tarde, mas é de longe a mais interessante para IA local: é a única das três que permite que um 14B em Q4 (aproximadamente 9 GB) caiba com folga. Verifique, portanto, a capacidade exata da placa antes de qualquer compra: apenas o nome não a indica.
#O que cada variante executa
A regra é a mesma para qualquer placa: os pesos em Q4 (referência do site: 3B ≈ 2 GB, 7-8B ≈ 5 GB, 14B ≈ 9 GB) mais o cache de contexto e cerca de 0,5 GB reservados pelo sistema e pelo mecanismo de inferência. A tabela também indica o limite teórico de geração, que é a largura de banda dividida pelo tamanho dos pesos. Não temos medições de velocidade de geração nessas placas e não citamos nenhuma.
| Modelo (Q4) | Tamanho do modelo | 2060 6 GB (336 GB/s) | 2060 Super 8 GB (448 GB/s) | 2060 12 GB |
|---|---|---|---|---|
| Gemma 4 2B | 1,2 GB | Sim, limite aproximado de 280 t/s | Sim, cerca de 370 t/s | Sim |
| Qwen 3.5 4B | 2,3 GB | Sim, cerca de 146 t/s | Sim, cerca de 195 t/s | Sim |
| Granite 4.2 8B | 4,6 GB | No limite, contexto muito curto, cerca de 73 t/s | Sim, cerca de 97 t/s | Sim |
| Qwen3 8B (Ollama) | 5,2 GB | Não de forma confiável | Sim, contexto moderado, cerca de 86 t/s | Sim |
| Qwen 3.5 9B | 6 GB | Não | No limite, cerca de 75 t/s | Sim |
| Qwen3 14B (Ollama) | 9,3 GB | Não | Não | Sim, contexto curto |
Esses limites nunca são atingidos na prática; servem para comparar as placas entre si e saber se um modelo será interativo. Um modelo que pesa o dobro gera a aproximadamente metade da velocidade. Para conversar, qualquer taxa real acima de cerca de dez tokens por segundo é confortável para a leitura.
#Turing em 2026: ainda com suporte
A idade da placa preocupa menos do que se imagina. A documentação do Ollama indica que ele oferece suporte a GPUs NVIDIA com capacidade de computação 5.0 ou superior e driver 550 ou mais recente, e lista a RTX 2060 na família de capacidade 7.5. As notas de versão do CUDA 13, por sua vez, indicam que o suporte a Maxwell, Pascal e Volta foi removido de algumas bibliotecas: a geração Turing é a mais antiga que permanece nesse caminho. Isso é um argumento a favor da 2060 em relação às GTX 10 a longo prazo, embora o Ollama ainda ofereça suporte às capacidades 5.0 a 6.2 com driver 570 ou mais recente: o risco é que as próximas funcionalidades sejam voltadas apenas às arquiteturas recentes.
Não é a capacidade de processamento que limita a geração de texto nessa placa, mas a largura de banda da memória: portanto, não pague mais apenas pelos Tensor Cores. O driver é o verdadeiro requisito: uma instalação atualizada evita a maioria das falhas de detecção da GPU.
#O cálculo de memória para sua placa
O cálculo é feito em três linhas: memória da placa, menos aproximadamente 0,5 GB reservados pelo sistema e pelo motor, menos o tamanho dos pesos do modelo, resulta no espaço restante para o cache de contexto. O consumo do cache por token depende da arquitetura do modelo; a calculadora do site informa esse valor para um modelo específico, e a quantização do cache em q8_0 reduz esse consumo aproximadamente à metade.
| Placa | Usável (memória − 0,5 GB) | Com Granite 4.2 8B (4,6 GB) | Com Qwen3 8B (5,2 GB) | Com Qwen3 14B (9,3 GB) |
|---|---|---|---|---|
| RTX 2060 6 GB | 5,5 GB | 0,9 GB | 0,3 GB | Não cabe |
| RTX 2060 Super 8 GB | 7,5 GB | 2,9 GB | 2,3 GB | Não cabe |
| RTX 2060 12 GB | 11,5 GB | 6,9 GB | 6,3 GB | 2,2 GB |
Essa tabela explica por que a mesma família de modelos é agradável de usar na Super e penosa na versão de 6 GB: com menos de um gigabyte de margem, alguns milhares de tokens de contexto bastam para que parte do modelo passe a ser executada na CPU. Ela também mostra que rodar o 14B em 12 GB é possível, mas deixa pouca folga: 2,2 GB para o contexto, o que exige uma janela curta.
#Dicas para as versões de 6 GB e 8 GB
Para a placa de 6 GB, o guia "Qual LLM para 6 GB de VRAM" detalha o orçamento completo de memória; em resumo, procure um modelo de 4B ou um de 8B com contexto curto. Na Super de 8 GB, o contexto passa a ser o primeiro parâmetro a monitorar.
- 01Instalar um driver recenteAtualize o driver NVIDIA para versão 550 ou mais recente, como exige o Ollama, e depois instale o Ollama no seu sistema.
- 02Escolher o tamanho do modelo6 GB: um 4B, ou um 8B com contexto curto. 8 GB: um 8B em Q4 com um contexto de 4 000 a 8 000 tokens. 12 GB: um 14B em Q4, contexto curto.
- 03Reduzir o cache de contextoAtive o Flash Attention e a quantização do cache em q8_0: ela reduz aproximadamente pela metade a memória do cache em comparação com f16, de acordo com a FAQ do Ollama.
- 04Verificar com o ollama psA coluna Processor deve mostrar 100% GPU. Uma divisão entre CPU e GPU indica que o modelo excede a capacidade da memória da GPU, resultando em uma velocidade mais baixa.
- 05Fechar os aplicativos que consomem muitos recursosUm navegador com aceleração de hardware ou um jogo ocupam VRAM que o modelo não poderá usar.
A FAQ do Ollama também propõe uma quantização q4_0 do cache, mais agressiva, que reduz ainda mais o uso de memória ao custo de uma possível perda de qualidade; teste-a no seu caso de uso antes de mantê-la.
#O que realmente se pode fazer com uma 2060
- Chat e redação
- Um modelo de 4B ou 8B responde corretamente no dia a dia; é nesse uso que a placa cumpre melhor suas promessas.
- RAG e documentos
- Um pequeno modelo de 4B e um modelo de embedding cabem na memória; limite o número de trechos enviados.
- Código
- Autocompletar código com um pequeno modelo de código; nenhum agente confiável nesse tamanho.
- O que excede a capacidade da placa
- Contextos grandes, tarefas de visão pesadas, modelos de 14B em 6 ou 8 GB e qualquer agente que execute ferramentas em sequência com prompts longos.
A 2060 também é uma placa de 160 a 185 W: sob carga contínua, ela aquece e faz barulho como qualquer placa de sua categoria. O guia sobre gerenciamento térmico explica como limitar a potência de um servidor que funciona o dia todo.
#Veredito e quando partir para outra opção
Uma RTX 2060 já instalada não precisa ser substituída se seus usos forem bate-papo, resumo de textos e RAG leve. Se você for comprar, a memória tem prioridade sobre tudo: a variante de 12 GB ou a 2060 Super de 8 GB são preferíveis à de 6 GB. Os preços mudam todas as semanas e não estão listados nesta página; o acompanhamento do site registra o preço mais baixo de cada placa.
| Placa | O que ela oferece | Quais concessões ela exige |
|---|---|---|
| RTX 2060 6 GB | Ponto de entrada, modelos de 3-4B | Pouca margem; 8B somente com contexto muito curto |
| RTX 2060 Super 8 GB | 8B em Q4 com folga | 448 GB/s, mais rápida que a 3060 de 12 GB |
| RTX 3060 12 GB | 12 GB: 14B em Q4 e contexto longo | 360 GB/s: mais lenta que a 2060 Super com o mesmo modelo que cabe nas duas |
| RTX 3050 6 GB | Eficiência energética | 168 GB/s, metade da velocidade da 2060 de 6 GB |
Esta comparação corrige uma ideia comum: a RTX 3060 12 GB não é mais rápida que a 2060 Super para a geração de texto. Sua largura de banda é de 360 GB/s de acordo com a Wikipédia, contra 448 GB/s para a 2060 Super. Ela vence por capacidade: 12 GB permitem carregar modelos que a Super não consegue acomodar. Escolha com base no modelo desejado, não em um percentual geral de velocidade.
Se você comprar uma placa usada, verifique três coisas antes de decidir ficar com ela. Verifique no nvidia-smi a memória total informada: o nome da placa não é suficiente para diferenciar as variantes de 6, 8 e 12 GB. Execute uma geração contínua por cerca de vinte minutos e monitore a temperatura e a frequência do núcleo da GPU: uma placa que perde muito desempenho precisa de limpeza ou de pasta térmica nova. Por fim, teste um modelo real com o contexto desejado e verifique com ollama ps se ele permanece inteiramente na placa.
- Qual LLM para RTX 3060 12 GB
- Qual LLM na RTX 2070 / 2070 Super
- Qual LLM em uma RTX 3050
- Acompanhamento dos preços das placas de vídeo para IA local
- Fonte: Wikipédia, série GeForce 20
- Fonte: Ollama, hardware compatível
- Fonte: FAQ oficial do Ollama
#Perguntas frequentes
A RTX 2060 pode rodar um LLM?+
Qual a data de lançamento da RTX 2060?+
RTX 2060 ou RTX 2060 Super para um LLM?+
Um LLM de 8B moderno cabe em uma RTX 2060 Super?+
A RTX 2060 de 6 GB ainda vale a pena para IA local?+
A RTX 3060 12 GB é mais rápida que a 2060 Super?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.