Iniciante 11 minRTX 20

Qual LLM na RTX 2070 / 2070 Super (8 GB) ?

Resposta direta

Uma RTX 2070 ou 2070 Super (8 GB de GDDR6) roda com conforto modelos de 7 a 9 bilhões de parâmetros em Q4: Granite 4.2 8B (4,6 GB de pesos) ou Qwen 3.5 9B (6 GB) cabem inteiramente na placa. No teste de referência do llama.cpp, a 2070 Super gera 88 tokens/s. Acima de 9B, é necessário transferir parte do modelo para a RAM do sistema, e a taxa de geração despenca.

A RTX 2070 (outubro de 2018) e a RTX 2070 Super (julho de 2019) são placas Turing com 8 GB de memória. Em 2026, elas estão no nível adequado para um assistente de 8B em Q4 e no limite para todo o restante. Este guia relaciona suas características a um teste público de velocidade, explica como os 8 GB são consumidos e indica quando vale a pena trocar de placa.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux
Hardware recomendado

Opção de compra para este guia: RTX 5060 Ti 16 GB.

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#RTX 2070 e 2070 Super: o que 8 GB permitem

Em uma RTX 2070 ou 2070 Super, modelos com entre 7 e 9 bilhões de parâmetros em quantização Q4 cabem inteiramente na memória de vídeo: é a faixa de conforto dessas placas. De acordo com o catálogo QuelLLM, os pesos do Granite 4.2 8B ocupam 4,6 GB em Q4, e os do Qwen 3.5 9B, cerca de 6 GB. Sobra então espaço para o contexto, desde que seu comprimento seja mantido em um nível razoável. Um modelo de 12 bilhões como Gemma 4 12B (7 GB em Q4) deixa apenas um gigabyte para o cache e o sistema: cabe no papel, mas funciona mal na prática. Quanto à velocidade, a 2070 Super registra 88 tokens por segundo no teste de referência do llama.cpp, com um modelo de 7 bilhões em Q4_0, bem acima da velocidade de leitura humana. O verdadeiro limite dessas placas não é a velocidade, mas a capacidade de memória.

RTX 2070
Outubro de 2018, 2.304 núcleos CUDA, 8 GB de GDDR6 em um barramento de 256 bits, ou seja, 448 GB/s (256 bits a 14 Gbit/s).
RTX 2070 Super
Julho de 2019, 2.560 núcleos CUDA, os mesmos 8 GB e a mesma largura de banda de 448 GB/s, consumo de 215 W.
O que os diferencia para um LLM
Quase nada: a largura de banda e a capacidade são iguais. A Super tem mais núcleos, o que ajuda principalmente na leitura do prompt, não na geração.

Esse último ponto é contraintuitivo: para gerar texto, o processador gráfico relê todos os pesos do modelo a cada token, de modo que a largura de banda da memória conta mais que o número de núcleos. Duas placas com 448 GB/s produzirão taxas de geração semelhantes, mesmo que uma seja significativamente mais rápida em jogos.

#Quais modelos cabem em 8 GB

Os pesos são apenas uma parte do custo: é preciso somar o cache de contexto (KV cache), que cresce com o tamanho da conversa, e depois uma margem para o driver e a exibição na tela. Em uma placa de 8 GB, a regra prática é limitar os pesos a no máximo 6 GB se você quiser um contexto de vários milhares de tokens. Como referência, a ferramenta de teste do llama.cpp mostra 7.838 MiB de memória livre em uma RTX 3060 Ti de 8 GB, ou seja, um pouco menos que os 8.192 MiB teóricos: algumas centenas de megabytes já estão ocupados antes mesmo de carregar um modelo.

Modelos para uma RTX 2070 / 2070 Super (peso de acordo com o catálogo QuelLLM)
ModeloPesos em Q4Veredito para 8 GB
Qwen 3.5 4B2,3 GB (Q8: 4,3 GB)Roda com muita folga, mesmo em Q8 e com um contexto longo
Granite 4.2 8B4,6 GB (Q8 : 9 GB)Zona de conforto em Q4, contexto de milhares de tokens
Qwen 3.5 9B6 GB (Q8 : 10 GB)Cabe em Q4 com um contexto moderado; use o cache K/V quantizado para contextos maiores
Gemma 4 12B7 GB (Q8: 13 GB)Limite: não há margem para o contexto; provável uso da RAM do sistema para a parte que não cabe na VRAM

Um modelo de 8B em Q8 (9 GB) não cabe: com 8 GB, a quantização Q4 é a regra, e a Q5 continua sendo possível para os modelos menores. Para comparar os níveis de quantização, o guia sobre a escolha entre Q4, Q5 e Q8 detalha a perda de qualidade esperada. Para um projeto específico, a calculadora de VRAM do site informa o consumo exato de memória de acordo com o modelo e o contexto.

#Velocidade: o que mede o teste de referência

A única referência pública utilizável é a tabela colaborativa do repositório llama.cpp, onde usuários publicam o resultado do mesmo comando: llama-bench com Llama 2 7B em Q4_0, um arquivo de 3,56 GiB, com todas as camadas na GPU. A tabela esclarece que os resultados variam conforme o driver, o sistema e o fabricante da placa, mesmo com o mesmo chip. Não são medições feitas pelo site: os números abaixo vêm dessa tabela, e a coluna “leitura” é a taxa de processamento do prompt (pp512), enquanto “geração” é a taxa de geração da resposta (tg128).

Teste llama.cpp, Llama 2 7B Q4_0, sem Flash Attention
PlacaMemóriaGeração (tok/s)Leitura do prompt (tok/s)
RTX 2060 Super8 GB60,01 420
RTX 2070 Super8 GB88,12 088
RTX 3060 12 GB12 GB75,62 138
RTX 2080 Ti11 GB107,52 891

Dois aprendizados. Primeiro, a 2070 Super gera mais rápido do que uma RTX 3060 de 12 GB (88,1 contra 75,6 tokens por segundo, ou seja, aproximadamente 17% de diferença): a velocidade não é o que justifica substituí-la. Em seguida, a RTX 2060 Super apresenta a mesma largura de banda de 448 GB/s que a 2070 Super, com um resultado de 60 tokens por segundo, ou seja, 32% a menos. Um limite de largura de banda não é uma previsão: o estado dos drivers, as frequências e a ficha técnica da placa também importam. Trate esses valores como ordens de grandeza.

#De um modelo de teste para um modelo atual: a regra de três

O modelo de teste pesa 3,82 GB (3,56 GiB). Como a geração é limitada pela leitura dos pesos, um modelo mais pesado é proporcionalmente mais lento, mantendo-se as demais condições iguais. Para Granite 4.2 8B em Q4 (4,6 GB), obtém-se, na melhor das hipóteses, 88 × 3,82 ÷ 4,6, ou seja, aproximadamente 73 tokens por segundo; para Qwen 3.5 9B em Q4 (6 GB), cerca de 56 tokens por segundo. Esses são limites superiores teóricos, não medições: as arquiteturas recentes (modelos híbridos, misturas de especialistas) e o comprimento do contexto alteram o resultado, para mais ou para menos.

Essa regra tem aplicação prática. Se um número anunciado para sua configuração for muito inferior a essas ordens de grandeza, por exemplo, menos de 15 tokens por segundo em um modelo de 8B em Q4, é sinal de que parte do modelo foi transferida para a RAM do sistema: verifique a ocupação da VRAM antes de culpar a placa. O guia de solução de problemas do Ollama descreve o procedimento a seguir.

#Contexto e cache KV: onde o limite de 8 GB entra em jogo

A taxa de geração diminui quando a conversa se alonga, porque o modelo também relê o cache a cada token. Em uma placa de 8 GB, a queda permanece moderada, da ordem de alguns por cento nas medições públicas disponíveis para placas semelhantes. O segundo efeito diz respeito à memória: o cache K/V ocupa VRAM proporcionalmente ao contexto. Dois ajustes do Ollama aliviam a carga sobre uma placa de 8 GB. Flash Attention reduz a memória consumida quando o contexto aumenta, e a documentação do Ollama esclarece que o cache K/V pode ser quantizado quando Flash Attention está ativada. O tipo q8_0 utiliza cerca da metade da memória do formato f16 padrão, com uma perda de precisão muito pequena segundo a documentação.

  1. 01
    Ativar Flash Attention
    Inicie o servidor com a variável OLLAMA_FLASH_ATTENTION=1. O Ollama ativa isso automaticamente quando a placa e o modelo o permitirem; a variável serve para forçar a ativação.
  2. 02
    Quantizar o cache K/V
    Adicione OLLAMA_KV_CACHE_TYPE=q8_0. Só passe para q4_0 como último recurso: a documentação indica uma possível degradação em contextos grandes.
  3. 03
    Verificar a ocupação
    Envie um prompt longo e observe a memória da placa com nvidia-smi: se a VRAM saturar, reduza o contexto em vez de deixar o Ollama transferir parte do modelo para a RAM.
Linux: iniciar Ollama com os dois ajustes
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

Na placa 2070 Super, o teste do llama.cpp com Flash Attention resulta em 87,7 tokens por segundo na geração, contra 88,1 sem: não se deve esperar ganho de velocidade aqui. Por outro lado, a leitura do prompt passa de 2.088 para 2.293 tokens por segundo, o que conta para documentos longos e para o RAG. Para se aprofundar nesse assunto, há um guia inteiro dedicado à quantização do cache.

#Turing em 2026: drivers, suporte e limites

As placas Turing continuam sendo suportadas. A documentação do Ollama exige uma capacidade de computação de pelo menos 5.0 e um driver 550 ou mais recente; as RTX 2070, 2080 e 2080 Ti constam na lista de placas com capacidade de computação 7.5. Turing tornou-se até o patamar mínimo: as notas de versão do CUDA 13 indicam que o suporte às arquiteturas anteriores a Turing (Maxwell, Volta e Pascal) foi descontinuado. Nada permite determinar uma data para o fim do suporte a Turing, e seria arriscado anunciar uma; a atitude prudente é acompanhar essas notas de versão a cada grande atualização do CUDA.

Uma limitação prática permanece: os modelos recentes saem geralmente primeiro em formatos projetados para hardware mais novo, e a comunidade oferece então conversões GGUF em Q4 para placas como a sua. Isso não bloqueia Ollama ou llama.cpp, mas pode atrasar um dia ou dois a disponibilidade de um modelo em formato legível.

#2070 Super, 3060 12 GB ou 3060 Ti: qual a escolha?

Três placas de 8 a 12 GB para uso com LLMs
PlacaMemóriaGeração (tok/s)O que ela oferece
RTX 2070 Super8 GB88,1Velocidade razoável; limite de 9B em Q4
RTX 3060 Ti8 GB92,2Um pouco mais rápido; mesmo limite de capacidade
RTX 3060 12 GB12 GB75,6Mais lenta, mas com 4 GB a mais: Gemma 4 12B em Q4 com margem

Com velocidade comparável, a capacidade é o fator decisivo. Passar de uma 2070 Super para uma 3060 Ti não muda o limite de 9B; passar para uma 3060 de 12 GB permite usar modelos de 12 bilhões e contextos longos, ao custo de uma taxa de geração um pouco menor. Os preços de placas usadas mudam todas as semanas: consulte o acompanhamento de preços do site antes de decidir.

#Veredito 2026: manter, comprar ou passar para outra opção

Mantenha-a se
Você usa um assistente de 7 a 9B em Q4 para código curto, resumos ou RAG moderado. A taxa de geração é bastante confortável e nada exige uma mudança.
Escolha outra opção se
Você quer um 12B com uma janela de contexto utilizável, um modelo de 14B ou mais, ou documentos muito longos. Nesse caso, precisa de pelo menos 12 GB, e 16 GB para ficar tranquilo.
Ao comprar uma placa usada
Uma 2070 Super só é interessante se o preço permanecer bem abaixo do de uma placa com 12 GB. Verifique a garantia e o estado do ventilador, essas placas têm vários anos de uso.

#Perguntas frequentes

Perguntas frequentes
A RTX 2070 consegue rodar um LLM em 2026?+
Sim, dentro do limite de seus 8 GB. Um modelo com 7 a 9 bilhões de parâmetros em Q4, como o Granite 4.2 8B ou o Qwen 3.5 9B, cabe inteiramente na placa. No teste de referência do llama.cpp, a 2070 Super gera 88 tokens por segundo, o que é mais do que suficiente para conversas ou ajuda com código.
RTX 2070 ou RTX 2070 Super para um LLM?+
As duas têm 8 GB de GDDR6 e a mesma largura de banda de 448 GB/s, e a geração depende principalmente da largura de banda. A Super, com mais núcleos, ajuda principalmente na leitura de prompts longos. Se a diferença de preço for significativa, a 2070 padrão oferece uma experiência de geração muito próxima.
É possível rodar o Gemma 4 12B em uma RTX 2070?+
Está no limite. O catálogo indica 7 GB de pesos em Q4, o que quase não deixa espaço para o cache de contexto e o sistema nos 8 GB disponíveis. O modelo carrega, mas logo passa a usar também a RAM assim que a conversa se alonga. Prefira Granite 4.2 8B ou Qwen 3.5 9B, ou passe para 12 GB de VRAM.
Quantos tokens por segundo na RTX 2070 Super?+
A tabela pública do llama.cpp indica 88 tokens por segundo para Llama 2 7B em Q4_0. Um modelo mais pesado será mais lento, com a redução de velocidade aproximadamente proporcional ao seu tamanho: como estimativa teórica, espere algo em torno de 55 a 75 tokens por segundo em um modelo de 8 a 9B em Q4. Um contexto longo reduz esse valor.
Os drivers atuais ainda oferecem suporte à RTX 2070?+
Sim. O Ollama lista as RTX 2070, 2080 e 2080 Ti entre as placas com capacidade de computação 7.5 e exige apenas um driver 550 ou mais recente. O CUDA 13 chegou a estabelecer Turing como a arquitetura mínima, abandonando as arquiteturas anteriores. Nenhum fim de suporte foi anunciado nas fontes consultadas.
Devo ativar o Flash Attention em uma RTX 2070?+
O Ollama a ativa automaticamente quando o hardware permite; você pode forçar sua ativação com OLLAMA_FLASH_ATTENTION=1. Na 2070 Super, ela não altera a velocidade de geração, mas acelera a leitura do prompt em aproximadamente 10% e reduz a memória usada em contextos longos, o que importa com 8 GB.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.