Intermediário 11 minRTX 20

Qual LLM para RTX 2080 / 2080 Super (8 GB) ?

Resposta direta

Uma RTX 2080 ou 2080 Super (8 GB de GDDR6) executa sem problemas modelos com 7 a 9 bilhões de parâmetros em Q4, como Granite 4.2 8B (4,6 GB) ou Qwen 3.5 9B (6 GB). Não há medições públicas para essas duas placas, mas seu barramento de 256 bits as coloca no nível da 2070 Super, com cerca de 88 tokens/s em um 7B. O limite continua sendo a capacidade de 8 GB.

As RTX 2080 (setembro de 2018) e 2080 Super (julho de 2019) eram placas topo de linha; em 2026, sua vantagem para a IA local é modesta, pois possuem apenas 8 GB. Este guia separa o que está documentado do que é estimado, compara essas placas com alternativas de 12 GB e explica como verificar se um modelo realmente cabe na memória.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux
Hardware recomendado

Opção de compra para este guia: RTX 5060 Ti 16 GB.

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#RTX 2080 e 2080 Super: o que elas executam

Em uma RTX 2080 ou 2080 Super, um modelo com 7 a 9 bilhões de parâmetros em Q4 cabe inteiramente na memória de vídeo e roda rapidamente. De acordo com o catálogo QuelLLM, Granite 4.2 8B requer 4,6 GB em Q4 e Qwen 3.5 9B requer 6 GB, o que deixa margem para um contexto de alguns milhares de tokens. Gemma 4 12B (7 GB em Q4) chega ao limite dos 8 GB e o ultrapassa assim que a conversa se alonga. Nenhuma dessas duas placas aparece na tabela pública de desempenho do llama.cpp; ainda assim, é possível estimar seu desempenho, pois elas compartilham o mesmo barramento de 256 bits da 2070 Super, que atingiu 88 tokens por segundo em um modelo de 7 bilhões de parâmetros em Q4_0. A 2080 Super, cuja memória é mais rápida, deve ter um desempenho ligeiramente melhor. Em resumo: rápida, mas limitada por seus 8 GB.

RTX 2080
Setembro de 2018, 2.944 núcleos CUDA, 8 GB de GDDR6, barramento de 256 bits, o que dá 448 GB/s a 14 Gbit/s.
RTX 2080 Super
Julho de 2019, 3.072 núcleos CUDA, 8 GB de GDDR6 a 15,5 Gbit/s, ou seja, 496 GB/s, cerca de 11 % a mais do que a 2080.
Para um LLM
A geração depende principalmente da largura de banda: a Super ganha um pouco, a capacidade não muda.

#Modelos compatíveis: aqueles que cabem em 8 GB

Modelos para RTX 2080 / 2080 Super (peso conforme o catálogo QuelLLM)
ModeloPesos em Q4O que se pode esperar com 8 GB
Granite 4.2 8B4,6 GBConfortável, contexto de milhares de tokens
Qwen 3.5 9B6 GBCabe em Q4; contexto moderado, ajuste o cache K/V se necessário
Gemma 4 12B7 GBMemória insuficiente: não sobra espaço para o cache e o sistema
Qwen 3.5 9B em Q810 GBNão cabe: ultrapassa os 8 GB

O raciocínio é o mesmo para todos os modelos: pesos, mais cache de contexto, mais uma margem de aproximadamente um gigabyte para o driver e a tela. Se a tela estiver conectada a essa placa, parte da memória já está reservada para ela. Com 8 GB, limitar os pesos a no máximo 6 GB é uma regra segura. Para um contexto mais longo, a quantização do cache K/V é a ferramenta que traz mais retorno.

#Verificar se um modelo realmente cabe na placa

Muitas perdas de velocidade vêm de um modelo que não cabe totalmente na VRAM: Ollama então transfere parte dele para o processador, e a taxa de geração cai sem mensagem de erro. A documentação do Ollama mostra como verificar isso: o comando ollama ps exibe, na coluna Processor, a memória em que o modelo foi carregado. A indicação 100% GPU significa que o modelo está inteiramente na placa, enquanto uma proporção como 48%/52% CPU/GPU indica um carregamento distribuído entre a RAM e a VRAM.

  1. 01
    Carregar o modelo
    Inicie o modelo com ollama run seguido do nome dele, depois envie um primeiro prompt.
  2. 02
    Ler a distribuição
    Em outro terminal, digite ollama ps. Anote a coluna Processor e o tamanho anunciado.
  3. 03
    Corrigir, se necessário
    Se o modelo não estiver em 100% no GPU, reduza o contexto, escolha uma quantização mais leve ou mude para um modelo menor. Quantizar o cache K/V ajuda também; a documentação especifica que isso exige Flash Attention.
Verificar a distribuição entre GPU e CPU
ollama ps

#Velocidade: o que é medido, o que é estimado

A tabela colaborativa do llama.cpp (Llama 2 7B em Q4_0, arquivo de 3,56 GiB) inclui a 2070 Super, a 2080 Ti, a 3060 de 12 GB e a 4060 Ti de 8 GB, mas não a 2080 nem a 2080 Super. A tabela esclarece que os resultados variam conforme o driver, o sistema e a placa, mesmo com um chip idêntico. Veja o que foi medido e, em seguida, o que é razoável deduzir desses resultados.

Teste llama.cpp, Llama 2 7B Q4_0, geração (tokens/s)
PlacaMemóriaBarramentoGeraçãoStatus
RTX 2070 Super8 GB256 bits88,1Medição publicada
RTX 2080 / 2080 Super8 GB256 bitsaproximadamente 88 a 97Estimativa: mesmo barramento, memória mais rápida na Super
RTX 2080 Ti11 GB352 bits107,5Medição publicada
RTX 3060 12 GB12 GB192 bits75,6Medição publicada
RTX 4060 Ti 8 GB8 GB128 bits63,9Medição publicada

A estimativa da linha 2080 segue uma regra simples: com 448 GB/s, a 2080 deve gerar tokens a uma taxa muito próxima à da 2070 Super, e com 496 GB/s, a 2080 Super pode ganhar até 10% a mais, chegando a uma ordem de grandeza de 95 tokens por segundo. É uma projeção, não uma medição: não a cite como resultado.

A tabela traz uma lição útil para quem hesita em substituir a placa: a RTX 4060 Ti de 8 GB, apesar de ser mais recente, gera mais lentamente (63,9 tokens por segundo) do que a 2070 Super, porque seu barramento de 128 bits limita a largura de banda. Na geração de texto, uma geração mais recente de GPUs não é sinônimo de velocidade superior. O que ela traz, principalmente, é eficiência energética e recursos recentes, e não capacidade de memória.

#2080 Super ou RTX 3060 12 GB: a capacidade prevalece

A 3060 de 12 GB gera mais devagar que a 2070 Super (75,6 contra 88,1 tokens por segundo no teste), mas oferece 4 GB a mais. É isso que importa para a IA local: em 12 GB, o Gemma 4 12B (7 GB em Q4) cabe com espaço de sobra para o contexto, algo que as placas de 8 GB não permitem. Uma 2080 Super não compensa essa desvantagem com sua velocidade, pois o aumento para cerca de 95 tokens por segundo não muda o fato de que um modelo de 12B não cabe na memória.

2080 Super ou 3060 12 GB: escolha
CritérioRTX 2080 SuperRTX 3060 12 GB
Memória8 GB12 GB
Geração (7B Q4_0)Estimada em cerca de 95 tokens/s75,6 tokens/s (medida)
Modelos de 12 bilhõesNão (7 GB de pesos, sem margem)Sim, com contexto
Modelos de 7 a 9 bilhõesSimSim

A conclusão depende, portanto, do seu objetivo. Para um assistente com 8 ou 9 bilhões de parâmetros, sua 2080 é suficiente e passar para uma 3060 de 12 GB não traz ganho de velocidade. Para usar um modelo de 12B ou contextos longos, a troca se justifica. Os preços de usados mudam toda semana: consulte o acompanhamento de preços em vez de se basear em um número fixo.

#Contexto longo com 8 GB: o cache K/V é decisivo

Em uma placa de 8 GB, não é o modelo que causa o problema, é o cache de contexto. Cada token da conversa acrescenta dados à memória, e um modelo de 8B em Q4 que cabia nela sem contexto pode exceder a capacidade quando você cola um documento longo. Há dois recursos no Ollama. O Flash Attention, que o software ativa automaticamente quando a placa permite, reduz a memória necessária à medida que o contexto cresce. Uma vez ativado, ele permite a quantização do cache K/V, cujo formato q8_0 utiliza cerca da metade da memória do formato padrão, segundo a documentação. O formato q4_0 economiza ainda mais, mas reduz a precisão de forma mais perceptível em contextos longos.

Linux: forçar o Flash Attention e quantizar o cache em q8_0
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

Este ajuste é global: aplica-se a todos os modelos servidos pela instância, o que é prático em uma máquina dedicada, mas deve ser levado em conta se você troca de modelo com frequência. A boa prática é medir antes de ajustar: carregue seu modelo, preencha um contexto representativo do seu uso e depois verifique com ollama ps se o modelo permanece 100% na GPU. Se for o caso, você tem margem; caso contrário, quantize o cache ou reduza o contexto.

#Quando 8 GB já não são suficientes: os níveis seguintes

O que cada nível de memória desbloqueia (peso em Q4, catálogo QuelLLM)
Memória da placaModelos que se tornam possíveisPesos em Q4
8 GB (sua placa)Modelos de 7 a 9 bilhões4,6 a 6 GB
12 GBGemma 4 12B com contexto7 GB
16 GBgpt-oss 20B (13 GB) ou Qwen 3.5 27B (16 GB, com pouquíssima margem)13 a 16 GB

A leitura dessa tabela é simples: cada aumento na capacidade de memória dá acesso a uma categoria de modelos, enquanto a velocidade pura não muda quase nada na experiência acima de 30 ou 40 tokens por segundo. Se você está hesitando em investir, pergunte-se primeiro qual modelo você quer rodar, depois escolha a placa com a memória correspondente. Um modelo de 27 bilhões em 16 GB já está no limite; se esse for seu objetivo, considere uma placa de 24 GB.

#Drivers e suporte em 2026

A RTX 2080 e a 2080 Ti fazem parte das placas com capacidade de cálculo 7.5 listadas por Ollama, que exige um driver 550 ou mais recente. Isso cobre as versões atuais de Ollama; se a instalação falhar, o primeiro passo é verificar a versão do driver com nvidia-smi. Não há, portanto, motivo para temer um bloqueio de software ao instalar Ollama ou llama.cpp nessas placas. O único ponto de atenção é a versão do driver: atualize antes de procurar falhas em outros lugares.

#Veredito 2026

Mantenha-a se
Já está no seu PC e você busca modelos de 7 a 9 bilhões em Q4. Velocidade amplamente suficiente, custo nulo.
Não compre para IA
A menos que o preço seja baixo e a garantia seja clara. Com preços semelhantes, uma placa de 12 GB oferece mais valor do que alguns tokens extras por segundo.
Escolha outra opção se
Você quer um 12B, um 14B ou mais, ou um contexto acima de dez mil tokens em um 8B. Nesse caso, serão necessários 12 a 16 GB.

#Perguntas frequentes

Perguntas frequentes
A RTX 2080 consegue rodar um modelo com 8 a 9 bilhões de parâmetros?+
Sim. Em Q4, o Granite 4.2 8B pesa 4,6 GB e o Qwen 3.5 9B, 6 GB, de acordo com o catálogo QuelLLM, o que cabe nos 8 GB da placa com um contexto moderado. Sua velocidade é comparável à de uma 2070 Super, medida em 88 tokens por segundo em um modelo de 7B em Q4_0.
RTX 2080 Super ou RTX 2080 Ti para um LLM?+
A 2080 Ti tem 11 GB e uma largura de banda de 616 GB/s, a 2080 Super tem 8 GB e 496 GB/s. Para um LLM, os 3 GB adicionais importam mais do que a velocidade: eles permitem executar modelos de 12 bilhões de parâmetros. Se seu orçamento permitir, a 2080 Ti é a melhor escolha entre as duas.
É possível rodar Gemma 4 12B em uma RTX 2080 Super?+
Não confortavelmente. O catálogo indica 7 GB de pesos em Q4, o que deixa apenas um gigabyte para o cache de contexto e o sistema em 8 GB. O modelo é carregado, mas o Ollama logo transfere parte dele para a RAM, como o comando ollama ps mostrará. Prefira um modelo de 8B ou 9B.
Como saber se meu modelo está totalmente na GPU?+
Use o comando ollama ps: a coluna Processor mostra 100% GPU quando o modelo está totalmente carregado na placa, e uma proporção do tipo 48%/52% CPU/GPU quando ele está dividido entre a placa e a memória do sistema. Nesse segundo caso, a velocidade cai significativamente, e é melhor reduzir o contexto ou o tamanho do modelo.
Uma RTX 2080 é mais rápida que uma RTX 4060 Ti 8 GB para gerar texto?+
Na tabela pública do llama.cpp, a 4060 Ti de 8 GB gera 63,9 tokens por segundo contra 88,1 da 2070 Super, cujo barramento é idêntico ao da 2080. O barramento de 128 bits da 4060 Ti limita sua largura de banda. Portanto, espere uma taxa de geração superior na 2080, com a mesma capacidade de memória.
Ollama continua funcionando em uma RTX 2080 em 2026?+
Sim. O Ollama lista a RTX 2080 entre as placas com capacidade de computação 7.5 e exige apenas um driver 550 ou mais recente. Nenhum fim de suporte foi anunciado para essa família na documentação consultada; apenas acompanhe as notas de versão dos drivers e do CUDA durante as atualizações principais.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.