Qual LLM na RTX 2080 Ti (11 GB) ?
Com 11 GB de GDDR6 e 616 GB/s de largura de banda, a RTX 2080 Ti executa inteiramente na memória da placa um modelo de 12 bilhões de parâmetros em Q4 como Gemma 4 12B (7 GB) ou um 8B em Q8 como Granite 4.2 8B (9 GB). No teste de referência do llama.cpp, ela gera 107 tokens/s em um modelo 7B em Q4_0. É um caso raro de uma placa de 2018 cuja capacidade continua útil.
A RTX 2080 Ti (setembro de 2018) é a única placa da geração Turing que ultrapassa 8 GB: ela tem 11. Este guia relaciona suas características a medições públicas, especifica quais modelos cabem nela, compara sua relação entre capacidade e velocidade com a de placas mais recentes e explica como instalá-la e verificar se nada excede a capacidade da VRAM.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Opção de compra para este guia: RTX 5060 Ti 16 GB.
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#RTX 2080 Ti em 2026: a capacidade que importa
A RTX 2080 Ti executa um modelo de 12 bilhões de parâmetros em Q4 sem ultrapassar a capacidade da VRAM, o que nenhuma placa de 8 GB consegue fazer adequadamente. De acordo com o catálogo QuelLLM, Gemma 4 12B pesa 7 GB em Q4, Granite 4.2 8B, 4,6 GB, e Qwen 3.5 9B, 6 GB; em Q8, Granite 4.2 8B chega a 9 GB, o que também cabe nos 11 GB. A placa utiliza um chip TU102, 4.352 núcleos CUDA e 11 GB de memória GDDR6 em um barramento de 352 bits, o que equivale a 616 GB/s. Na tabela pública do llama.cpp, ela atinge 107,5 tokens por segundo em geração com um modelo de 7 bilhões de parâmetros em Q4_0. Essa combinação de velocidade e capacidade explica por que a 2080 Ti continua relevante, embora placas mais recentes de 8 GB a superem em jogos, mas não em IA.
- Arquitetura
- Turing, chip TU102, lançamento em setembro de 2018.
- Memória
- 11 GB de GDDR6, barramento de 352 bits, largura de banda de 616 GB/s.
- Cœurs
- 4.352 núcleos CUDA e núcleos Tensor de segunda geração.
- Alimentação
- Consulte a ficha do seu modelo específico: as versões de fábrica variam conforme o fabricante.
#Modelos compatíveis com 11 GB
| Modelo | Q4 | Q5 | Q8 | Com 11 GB |
|---|---|---|---|---|
| Granite 4.2 8B | 4,6 GB | 6 GB | 9 GB | Q4 e Q5 rodam com bastante folga; Q8 é possível com um contexto moderado |
| Qwen 3.5 9B | 6 GB | 7 GB | 10 GB | Q4 e Q5 confortáveis; o Q8 deixa apenas 1 GB para o contexto |
| Gemma 4 12B | 7 GB | 9 GB | 13 GB | Q4 com 3 a 4 GB de margem; Q5 cabe por pouco; o Q8 não cabe |
A coluna Q5 mostra a vantagem de uma placa de 11 GB: em um modelo de 8B ou 9B, é possível escolher uma quantização mais fiel que a Q4 sem sacrificar nada. A Q5 de um modelo de 12B (9 GB) deixa, por outro lado, menos de 2 GB para o cache, o que limita o contexto. Um modelo em Q4 com um contexto amplo costuma ser mais útil que um em Q5 com uma janela restrita: escolha conforme seu uso, seja para resumir documentos longos ou para conversas curtas.
Dois pontos práticos. Primeiro, o Q8 de um modelo de 8B (9 GB) cabe na placa e oferece uma qualidade muito próxima da precisão plena: é um uso que as placas de 8 GB não permitem. Segundo, a margem de 3 a 4 GB em um modelo de 12B em Q4 é consumida pelo contexto: além de alguns milhares de tokens, quantize o cache K/V ou reduza a janela. Para a escolha do nível de quantização, o guia dedicado detalha as perdas de qualidade.
#Instalação e verificação
Turing é compatível com Ollama: a documentação lista as placas RTX 2080 Ti, 2080, 2070 e 2060 entre as placas com capacidade de cálculo 7.5 e exige um driver 550 ou mais recente. O procedimento é o mesmo de qualquer placa NVIDIA, com uma última verificação importante: verificar se o modelo está inteiramente na placa.
- 01Atualizar o driverInstale um driver NVIDIA versão 550 ou mais recente, depois verifique com nvidia-smi se a placa é detectada com seus 11 GB.
- 02Instalar OllamaSiga o guia de instalação do Ollama para o seu sistema, depois inicie um modelo com o comando ollama run.
- 03Verificar a distribuiçãoDigite ollama ps: a coluna Processor deve exibir 100% GPU. Se aparecer um percentual de CPU, o modelo está usando também a RAM: reduza o tamanho do contexto ou do modelo.
- 04Ajustar o cache K/V, se necessárioInicie Ollama com OLLAMA_FLASH_ATTENTION=1 e OLLAMA_KV_CACHE_TYPE=q8_0 para ganhar espaço em contextos longos.
#Velocidade: o que mede o llama.cpp
A tabela colaborativa do repositório llama.cpp apresenta, para a RTX 2080 Ti, 107,5 tokens por segundo na geração e 2.891 na leitura do prompt com Llama 2 7B em Q4_0, um arquivo de 3,56 GiB. Com Flash Attention, esses valores passam para 109,2 e 3.108. Um ponto chama a atenção: a largura de banda de 616 GB/s permitiria, em teoria, cerca de 161 tokens por segundo com esse arquivo de 3,82 GB, mas o resultado medido atinge 67% desse valor. As placas mais modestas se aproximam mais desse limite teórico. A taxa real depende, portanto, de outros fatores além da memória, como as frequências ou os drivers, e a própria tabela lembra que os resultados variam conforme a placa e o sistema.
Para estimar a velocidade de um modelo atual, pode-se aplicar uma regra de três com o tamanho do arquivo. Um modelo de 4,6 GB como Granite 4.2 8B em Q4 daria, no máximo, 107,5 × 3,82 ÷ 4,6, ou seja, cerca de 89 tokens por segundo. Para um Gemma 4 12B de 7 GB, cai a cerca de 59 tokens por segundo. São limites teóricos superiores, não medidas; as arquiteturas recentes podem se afastar disso. Em todos os casos, essas velocidades ultrapassam a velocidade de leitura.
#Contexto longo e documentos: leitura do prompt e cache K/V
A velocidade de geração é apenas metade da experiência: assim que você cola um documento ou inicia uma pesquisa em seus arquivos, é a leitura do prompt que faz você esperar. A tabela do llama.cpp mede essa leitura separadamente (pp512). A 2 891 tokens por segundo, a 2080 Ti lê um documento de 10 000 tokens em pouco mais de três segundos e meio, contra cerca de quatro segundos e meio para a 3060 de 12 GB (2 138) e dois segundos para a 3080 de 10 GB (5 014). Esse cálculo é teórico e pressupõe uma taxa constante, mas dá uma ideia da ordem de grandeza: a 2080 Ti continua oferecendo uma experiência agradável para RAG.
A segunda restrição é a memória. O cache K/V aumenta com o contexto, e em um modelo de 12B em Q4 que deixa 3 a 4 GB de margem, um documento longo consome rapidamente essa reserva. A documentação de Ollama especifica que o cache K/V pode ser quantizado quando o Flash Attention está ativado, e que o formato q8_0 utiliza aproximadamente metade da memória do formato f16 padrão. A configuração é global para a instância Ollama: aplica-se a todos os modelos servidos.
Faça testes com medições: carregue o modelo, preencha um contexto comparável ao seu uso real e verifique com ollama ps se a execução permanece 100% na GPU. Se o modelo exceder a capacidade da GPU, a solução mais barata é quase sempre reduzir a janela de contexto, antes de mudar de modelo ou de placa. O guia sobre a janela de contexto explica como ajustá-la.
#2080 Ti, 3060 12 GB, 5060 Ti 16 GB: qual a escolha?
| Placa | Memória | Geração (tok/s) | Leitura do prompt (tok/s) |
|---|---|---|---|
| RTX 3060 12 GB | 12 GB | 75,6 | 2 138 |
| RTX 5060 Ti 16 GB | 16 GB | 90,9 | 3 737 |
| RTX 2080 Ti | 11 GB | 107,5 | 2 891 |
| RTX 3080 10 GB | 10 GB | 139,7 | 5 014 |
A 2080 Ti gera cerca de 42% mais rápido que a 3060 de 12 GB, e até mais rápido que a RTX 5060 Ti de 16 GB, cujo barramento de 128 bits limita o desempenho. Em termos de memória, porém, a 2080 Ti fica atrás das duas: 11 GB contra 12 e 16 GB, respectivamente. A escolha depende, portanto, do modelo desejado. Para um modelo de 12B em Q4, a 2080 Ti é suficiente e continua sendo a mais rápida das três. Para um modelo de 20 bilhões de parâmetros ou mais, ou um contexto muito longo, são necessários 16 GB e a placa de nova geração se torna a melhor opção. Os preços mudam toda semana; o acompanhamento no site mostra o preço por GB de VRAM.
- Pergunta 1: qual modelo você deseja?
- Um modelo de 8 a 12B: mantenha ou compre a 2080 Ti. Um modelo de 20B ou mais: procure uma placa com 16 GB.
- Pergunta 2: qual comprimento de contexto?
- Alguns milhares de tokens: 11 GB são suficientes. Dezenas de milhares: a margem será insuficiente.
- Pergunta 3: qual é o orçamento para energia elétrica?
- Compare o consumo indicado na ficha técnica do seu modelo de placa com o das placas recentes, que são mais econômicas a uma velocidade comparável.
- Preços de placas de vídeo para IA local (acompanhamento semanal)
- Qual LLM para RTX 3060 12 GB?
- Qual LLM na RTX 5060 Ti (8 / 16 GB)?
#Suporte à arquitetura Turing: o que está confirmado e o que não está
Turing é hoje a arquitetura mínima compatível com CUDA 13: as notas de versão indicam que o suporte às arquiteturas anteriores (Maxwell, Volta, Pascal) foi abandonado em suas bibliotecas. Isso significa que a 2080 Ti é compatível, mas também que é uma das placas mais antigas ainda incluídas. Nenhuma fonte consultada anuncia o fim do suporte a Turing; por outro lado, as novidades de hardware das gerações recentes (formatos de cálculo mais econômicos, por exemplo) nunca estarão disponíveis nessa arquitetura. Para llama.cpp e Ollama com modelos GGUF clássicos, isso não é um obstáculo.
#Veredito 2026
- Mantenha-a se
- Você já tem essa placa: os 11 GB e os 107 tokens por segundo em um modelo 7B fazem dela uma placa mais útil para IA do que muitas placas recentes de 8 GB.
- Compre usada se
- O preço é significativamente inferior ao de uma placa de 12 a 16 GB, e seu alvo é um modelo de 8 ou 12B. Verifique o estado dos ventiladores e a garantia; essas placas têm vários anos de uso.
- Aumente para 16 GB se
- Você busca um modelo de 20 bilhões ou mais, ou um contexto de dezenas de milhares de tokens.
#Perguntas frequentes
A RTX 2080 Ti ainda é relevante para um LLM em 2026?+
RTX 2080 Ti ou RTX 3060 12 GB para um LLM?+
Quantos tokens por segundo em uma RTX 2080 Ti?+
A RTX 2080 Ti suporta o Flash Attention?+
Como saber se o meu modelo cabe inteiramente na placa?+
A RTX 2080 Ti corre o risco de não ser mais suportada?+
- Fonte: tabela de desempenho do llama.cpp em CUDA
- Fonte: placas NVIDIA suportadas pelo Ollama
- Fonte: FAQ do Ollama (ollama ps, cache K/V)
- Fonte: especificações das placas GeForce da série 20
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.