Qual LLM na RTX 2070 / 2070 Super (8 GB) ?
Uma RTX 2070 ou 2070 Super (8 GB de GDDR6) roda com conforto modelos de 7 a 9 bilhões de parâmetros em Q4: Granite 4.2 8B (4,6 GB de pesos) ou Qwen 3.5 9B (6 GB) cabem inteiramente na placa. No teste de referência do llama.cpp, a 2070 Super gera 88 tokens/s. Acima de 9B, é necessário transferir parte do modelo para a RAM do sistema, e a taxa de geração despenca.
A RTX 2070 (outubro de 2018) e a RTX 2070 Super (julho de 2019) são placas Turing com 8 GB de memória. Em 2026, elas estão no nível adequado para um assistente de 8B em Q4 e no limite para todo o restante. Este guia relaciona suas características a um teste público de velocidade, explica como os 8 GB são consumidos e indica quando vale a pena trocar de placa.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Opção de compra para este guia: RTX 5060 Ti 16 GB.
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#RTX 2070 e 2070 Super: o que 8 GB permitem
Em uma RTX 2070 ou 2070 Super, modelos com entre 7 e 9 bilhões de parâmetros em quantização Q4 cabem inteiramente na memória de vídeo: é a faixa de conforto dessas placas. De acordo com o catálogo QuelLLM, os pesos do Granite 4.2 8B ocupam 4,6 GB em Q4, e os do Qwen 3.5 9B, cerca de 6 GB. Sobra então espaço para o contexto, desde que seu comprimento seja mantido em um nível razoável. Um modelo de 12 bilhões como Gemma 4 12B (7 GB em Q4) deixa apenas um gigabyte para o cache e o sistema: cabe no papel, mas funciona mal na prática. Quanto à velocidade, a 2070 Super registra 88 tokens por segundo no teste de referência do llama.cpp, com um modelo de 7 bilhões em Q4_0, bem acima da velocidade de leitura humana. O verdadeiro limite dessas placas não é a velocidade, mas a capacidade de memória.
- RTX 2070
- Outubro de 2018, 2.304 núcleos CUDA, 8 GB de GDDR6 em um barramento de 256 bits, ou seja, 448 GB/s (256 bits a 14 Gbit/s).
- RTX 2070 Super
- Julho de 2019, 2.560 núcleos CUDA, os mesmos 8 GB e a mesma largura de banda de 448 GB/s, consumo de 215 W.
- O que os diferencia para um LLM
- Quase nada: a largura de banda e a capacidade são iguais. A Super tem mais núcleos, o que ajuda principalmente na leitura do prompt, não na geração.
Esse último ponto é contraintuitivo: para gerar texto, o processador gráfico relê todos os pesos do modelo a cada token, de modo que a largura de banda da memória conta mais que o número de núcleos. Duas placas com 448 GB/s produzirão taxas de geração semelhantes, mesmo que uma seja significativamente mais rápida em jogos.
#Quais modelos cabem em 8 GB
Os pesos são apenas uma parte do custo: é preciso somar o cache de contexto (KV cache), que cresce com o tamanho da conversa, e depois uma margem para o driver e a exibição na tela. Em uma placa de 8 GB, a regra prática é limitar os pesos a no máximo 6 GB se você quiser um contexto de vários milhares de tokens. Como referência, a ferramenta de teste do llama.cpp mostra 7.838 MiB de memória livre em uma RTX 3060 Ti de 8 GB, ou seja, um pouco menos que os 8.192 MiB teóricos: algumas centenas de megabytes já estão ocupados antes mesmo de carregar um modelo.
| Modelo | Pesos em Q4 | Veredito para 8 GB |
|---|---|---|
| Qwen 3.5 4B | 2,3 GB (Q8: 4,3 GB) | Roda com muita folga, mesmo em Q8 e com um contexto longo |
| Granite 4.2 8B | 4,6 GB (Q8 : 9 GB) | Zona de conforto em Q4, contexto de milhares de tokens |
| Qwen 3.5 9B | 6 GB (Q8 : 10 GB) | Cabe em Q4 com um contexto moderado; use o cache K/V quantizado para contextos maiores |
| Gemma 4 12B | 7 GB (Q8: 13 GB) | Limite: não há margem para o contexto; provável uso da RAM do sistema para a parte que não cabe na VRAM |
Um modelo de 8B em Q8 (9 GB) não cabe: com 8 GB, a quantização Q4 é a regra, e a Q5 continua sendo possível para os modelos menores. Para comparar os níveis de quantização, o guia sobre a escolha entre Q4, Q5 e Q8 detalha a perda de qualidade esperada. Para um projeto específico, a calculadora de VRAM do site informa o consumo exato de memória de acordo com o modelo e o contexto.
#Velocidade: o que mede o teste de referência
A única referência pública utilizável é a tabela colaborativa do repositório llama.cpp, onde usuários publicam o resultado do mesmo comando: llama-bench com Llama 2 7B em Q4_0, um arquivo de 3,56 GiB, com todas as camadas na GPU. A tabela esclarece que os resultados variam conforme o driver, o sistema e o fabricante da placa, mesmo com o mesmo chip. Não são medições feitas pelo site: os números abaixo vêm dessa tabela, e a coluna “leitura” é a taxa de processamento do prompt (pp512), enquanto “geração” é a taxa de geração da resposta (tg128).
| Placa | Memória | Geração (tok/s) | Leitura do prompt (tok/s) |
|---|---|---|---|
| RTX 2060 Super | 8 GB | 60,0 | 1 420 |
| RTX 2070 Super | 8 GB | 88,1 | 2 088 |
| RTX 3060 12 GB | 12 GB | 75,6 | 2 138 |
| RTX 2080 Ti | 11 GB | 107,5 | 2 891 |
Dois aprendizados. Primeiro, a 2070 Super gera mais rápido do que uma RTX 3060 de 12 GB (88,1 contra 75,6 tokens por segundo, ou seja, aproximadamente 17% de diferença): a velocidade não é o que justifica substituí-la. Em seguida, a RTX 2060 Super apresenta a mesma largura de banda de 448 GB/s que a 2070 Super, com um resultado de 60 tokens por segundo, ou seja, 32% a menos. Um limite de largura de banda não é uma previsão: o estado dos drivers, as frequências e a ficha técnica da placa também importam. Trate esses valores como ordens de grandeza.
#De um modelo de teste para um modelo atual: a regra de três
O modelo de teste pesa 3,82 GB (3,56 GiB). Como a geração é limitada pela leitura dos pesos, um modelo mais pesado é proporcionalmente mais lento, mantendo-se as demais condições iguais. Para Granite 4.2 8B em Q4 (4,6 GB), obtém-se, na melhor das hipóteses, 88 × 3,82 ÷ 4,6, ou seja, aproximadamente 73 tokens por segundo; para Qwen 3.5 9B em Q4 (6 GB), cerca de 56 tokens por segundo. Esses são limites superiores teóricos, não medições: as arquiteturas recentes (modelos híbridos, misturas de especialistas) e o comprimento do contexto alteram o resultado, para mais ou para menos.
Essa regra tem aplicação prática. Se um número anunciado para sua configuração for muito inferior a essas ordens de grandeza, por exemplo, menos de 15 tokens por segundo em um modelo de 8B em Q4, é sinal de que parte do modelo foi transferida para a RAM do sistema: verifique a ocupação da VRAM antes de culpar a placa. O guia de solução de problemas do Ollama descreve o procedimento a seguir.
#Contexto e cache KV: onde o limite de 8 GB entra em jogo
A taxa de geração diminui quando a conversa se alonga, porque o modelo também relê o cache a cada token. Em uma placa de 8 GB, a queda permanece moderada, da ordem de alguns por cento nas medições públicas disponíveis para placas semelhantes. O segundo efeito diz respeito à memória: o cache K/V ocupa VRAM proporcionalmente ao contexto. Dois ajustes do Ollama aliviam a carga sobre uma placa de 8 GB. Flash Attention reduz a memória consumida quando o contexto aumenta, e a documentação do Ollama esclarece que o cache K/V pode ser quantizado quando Flash Attention está ativada. O tipo q8_0 utiliza cerca da metade da memória do formato f16 padrão, com uma perda de precisão muito pequena segundo a documentação.
- 01Ativar Flash AttentionInicie o servidor com a variável OLLAMA_FLASH_ATTENTION=1. O Ollama ativa isso automaticamente quando a placa e o modelo o permitirem; a variável serve para forçar a ativação.
- 02Quantizar o cache K/VAdicione OLLAMA_KV_CACHE_TYPE=q8_0. Só passe para q4_0 como último recurso: a documentação indica uma possível degradação em contextos grandes.
- 03Verificar a ocupaçãoEnvie um prompt longo e observe a memória da placa com nvidia-smi: se a VRAM saturar, reduza o contexto em vez de deixar o Ollama transferir parte do modelo para a RAM.
Na placa 2070 Super, o teste do llama.cpp com Flash Attention resulta em 87,7 tokens por segundo na geração, contra 88,1 sem: não se deve esperar ganho de velocidade aqui. Por outro lado, a leitura do prompt passa de 2.088 para 2.293 tokens por segundo, o que conta para documentos longos e para o RAG. Para se aprofundar nesse assunto, há um guia inteiro dedicado à quantização do cache.
#Turing em 2026: drivers, suporte e limites
As placas Turing continuam sendo suportadas. A documentação do Ollama exige uma capacidade de computação de pelo menos 5.0 e um driver 550 ou mais recente; as RTX 2070, 2080 e 2080 Ti constam na lista de placas com capacidade de computação 7.5. Turing tornou-se até o patamar mínimo: as notas de versão do CUDA 13 indicam que o suporte às arquiteturas anteriores a Turing (Maxwell, Volta e Pascal) foi descontinuado. Nada permite determinar uma data para o fim do suporte a Turing, e seria arriscado anunciar uma; a atitude prudente é acompanhar essas notas de versão a cada grande atualização do CUDA.
Uma limitação prática permanece: os modelos recentes saem geralmente primeiro em formatos projetados para hardware mais novo, e a comunidade oferece então conversões GGUF em Q4 para placas como a sua. Isso não bloqueia Ollama ou llama.cpp, mas pode atrasar um dia ou dois a disponibilidade de um modelo em formato legível.
#2070 Super, 3060 12 GB ou 3060 Ti: qual a escolha?
| Placa | Memória | Geração (tok/s) | O que ela oferece |
|---|---|---|---|
| RTX 2070 Super | 8 GB | 88,1 | Velocidade razoável; limite de 9B em Q4 |
| RTX 3060 Ti | 8 GB | 92,2 | Um pouco mais rápido; mesmo limite de capacidade |
| RTX 3060 12 GB | 12 GB | 75,6 | Mais lenta, mas com 4 GB a mais: Gemma 4 12B em Q4 com margem |
Com velocidade comparável, a capacidade é o fator decisivo. Passar de uma 2070 Super para uma 3060 Ti não muda o limite de 9B; passar para uma 3060 de 12 GB permite usar modelos de 12 bilhões e contextos longos, ao custo de uma taxa de geração um pouco menor. Os preços de placas usadas mudam todas as semanas: consulte o acompanhamento de preços do site antes de decidir.
- Preços de placas de vídeo para IA local (acompanhamento semanal)
- Qual LLM para RTX 3060 12 GB?
- Qual LLM para 8 GB de VRAM? (todas as placas)
#Veredito 2026: manter, comprar ou passar para outra opção
- Mantenha-a se
- Você usa um assistente de 7 a 9B em Q4 para código curto, resumos ou RAG moderado. A taxa de geração é bastante confortável e nada exige uma mudança.
- Escolha outra opção se
- Você quer um 12B com uma janela de contexto utilizável, um modelo de 14B ou mais, ou documentos muito longos. Nesse caso, precisa de pelo menos 12 GB, e 16 GB para ficar tranquilo.
- Ao comprar uma placa usada
- Uma 2070 Super só é interessante se o preço permanecer bem abaixo do de uma placa com 12 GB. Verifique a garantia e o estado do ventilador, essas placas têm vários anos de uso.
#Perguntas frequentes
A RTX 2070 consegue rodar um LLM em 2026?+
RTX 2070 ou RTX 2070 Super para um LLM?+
É possível rodar o Gemma 4 12B em uma RTX 2070?+
Quantos tokens por segundo na RTX 2070 Super?+
Os drivers atuais ainda oferecem suporte à RTX 2070?+
Devo ativar o Flash Attention em uma RTX 2070?+
- Fonte: tabela de desempenho do llama.cpp em CUDA
- Fonte: placas NVIDIA suportadas pelo Ollama
- Fonte: FAQ do Ollama (Flash Attention, cache K/V)
- Fonte: especificações das placas GeForce da série 20
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.