Intermediário 11 minRTX 20

Qual LLM na RTX 2080 Ti (11 GB) ?

Resposta direta

Com 11 GB de GDDR6 e 616 GB/s de largura de banda, a RTX 2080 Ti executa inteiramente na memória da placa um modelo de 12 bilhões de parâmetros em Q4 como Gemma 4 12B (7 GB) ou um 8B em Q8 como Granite 4.2 8B (9 GB). No teste de referência do llama.cpp, ela gera 107 tokens/s em um modelo 7B em Q4_0. É um caso raro de uma placa de 2018 cuja capacidade continua útil.

A RTX 2080 Ti (setembro de 2018) é a única placa da geração Turing que ultrapassa 8 GB: ela tem 11. Este guia relaciona suas características a medições públicas, especifica quais modelos cabem nela, compara sua relação entre capacidade e velocidade com a de placas mais recentes e explica como instalá-la e verificar se nada excede a capacidade da VRAM.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux
Hardware recomendado

Opção de compra para este guia: RTX 5060 Ti 16 GB.

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#RTX 2080 Ti em 2026: a capacidade que importa

A RTX 2080 Ti executa um modelo de 12 bilhões de parâmetros em Q4 sem ultrapassar a capacidade da VRAM, o que nenhuma placa de 8 GB consegue fazer adequadamente. De acordo com o catálogo QuelLLM, Gemma 4 12B pesa 7 GB em Q4, Granite 4.2 8B, 4,6 GB, e Qwen 3.5 9B, 6 GB; em Q8, Granite 4.2 8B chega a 9 GB, o que também cabe nos 11 GB. A placa utiliza um chip TU102, 4.352 núcleos CUDA e 11 GB de memória GDDR6 em um barramento de 352 bits, o que equivale a 616 GB/s. Na tabela pública do llama.cpp, ela atinge 107,5 tokens por segundo em geração com um modelo de 7 bilhões de parâmetros em Q4_0. Essa combinação de velocidade e capacidade explica por que a 2080 Ti continua relevante, embora placas mais recentes de 8 GB a superem em jogos, mas não em IA.

Arquitetura
Turing, chip TU102, lançamento em setembro de 2018.
Memória
11 GB de GDDR6, barramento de 352 bits, largura de banda de 616 GB/s.
Cœurs
4.352 núcleos CUDA e núcleos Tensor de segunda geração.
Alimentação
Consulte a ficha do seu modelo específico: as versões de fábrica variam conforme o fabricante.

#Modelos compatíveis com 11 GB

Modelos para uma RTX 2080 Ti (peso conforme o catálogo QuelLLM)
ModeloQ4Q5Q8Com 11 GB
Granite 4.2 8B4,6 GB6 GB9 GBQ4 e Q5 rodam com bastante folga; Q8 é possível com um contexto moderado
Qwen 3.5 9B6 GB7 GB10 GBQ4 e Q5 confortáveis; o Q8 deixa apenas 1 GB para o contexto
Gemma 4 12B7 GB9 GB13 GBQ4 com 3 a 4 GB de margem; Q5 cabe por pouco; o Q8 não cabe

A coluna Q5 mostra a vantagem de uma placa de 11 GB: em um modelo de 8B ou 9B, é possível escolher uma quantização mais fiel que a Q4 sem sacrificar nada. A Q5 de um modelo de 12B (9 GB) deixa, por outro lado, menos de 2 GB para o cache, o que limita o contexto. Um modelo em Q4 com um contexto amplo costuma ser mais útil que um em Q5 com uma janela restrita: escolha conforme seu uso, seja para resumir documentos longos ou para conversas curtas.

Dois pontos práticos. Primeiro, o Q8 de um modelo de 8B (9 GB) cabe na placa e oferece uma qualidade muito próxima da precisão plena: é um uso que as placas de 8 GB não permitem. Segundo, a margem de 3 a 4 GB em um modelo de 12B em Q4 é consumida pelo contexto: além de alguns milhares de tokens, quantize o cache K/V ou reduza a janela. Para a escolha do nível de quantização, o guia dedicado detalha as perdas de qualidade.

#Instalação e verificação

Turing é compatível com Ollama: a documentação lista as placas RTX 2080 Ti, 2080, 2070 e 2060 entre as placas com capacidade de cálculo 7.5 e exige um driver 550 ou mais recente. O procedimento é o mesmo de qualquer placa NVIDIA, com uma última verificação importante: verificar se o modelo está inteiramente na placa.

  1. 01
    Atualizar o driver
    Instale um driver NVIDIA versão 550 ou mais recente, depois verifique com nvidia-smi se a placa é detectada com seus 11 GB.
  2. 02
    Instalar Ollama
    Siga o guia de instalação do Ollama para o seu sistema, depois inicie um modelo com o comando ollama run.
  3. 03
    Verificar a distribuição
    Digite ollama ps: a coluna Processor deve exibir 100% GPU. Se aparecer um percentual de CPU, o modelo está usando também a RAM: reduza o tamanho do contexto ou do modelo.
  4. 04
    Ajustar o cache K/V, se necessário
    Inicie Ollama com OLLAMA_FLASH_ATTENTION=1 e OLLAMA_KV_CACHE_TYPE=q8_0 para ganhar espaço em contextos longos.

#Velocidade: o que mede o llama.cpp

A tabela colaborativa do repositório llama.cpp apresenta, para a RTX 2080 Ti, 107,5 tokens por segundo na geração e 2.891 na leitura do prompt com Llama 2 7B em Q4_0, um arquivo de 3,56 GiB. Com Flash Attention, esses valores passam para 109,2 e 3.108. Um ponto chama a atenção: a largura de banda de 616 GB/s permitiria, em teoria, cerca de 161 tokens por segundo com esse arquivo de 3,82 GB, mas o resultado medido atinge 67% desse valor. As placas mais modestas se aproximam mais desse limite teórico. A taxa real depende, portanto, de outros fatores além da memória, como as frequências ou os drivers, e a própria tabela lembra que os resultados variam conforme a placa e o sistema.

Para estimar a velocidade de um modelo atual, pode-se aplicar uma regra de três com o tamanho do arquivo. Um modelo de 4,6 GB como Granite 4.2 8B em Q4 daria, no máximo, 107,5 × 3,82 ÷ 4,6, ou seja, cerca de 89 tokens por segundo. Para um Gemma 4 12B de 7 GB, cai a cerca de 59 tokens por segundo. São limites teóricos superiores, não medidas; as arquiteturas recentes podem se afastar disso. Em todos os casos, essas velocidades ultrapassam a velocidade de leitura.

#Contexto longo e documentos: leitura do prompt e cache K/V

A velocidade de geração é apenas metade da experiência: assim que você cola um documento ou inicia uma pesquisa em seus arquivos, é a leitura do prompt que faz você esperar. A tabela do llama.cpp mede essa leitura separadamente (pp512). A 2 891 tokens por segundo, a 2080 Ti lê um documento de 10 000 tokens em pouco mais de três segundos e meio, contra cerca de quatro segundos e meio para a 3060 de 12 GB (2 138) e dois segundos para a 3080 de 10 GB (5 014). Esse cálculo é teórico e pressupõe uma taxa constante, mas dá uma ideia da ordem de grandeza: a 2080 Ti continua oferecendo uma experiência agradável para RAG.

A segunda restrição é a memória. O cache K/V aumenta com o contexto, e em um modelo de 12B em Q4 que deixa 3 a 4 GB de margem, um documento longo consome rapidamente essa reserva. A documentação de Ollama especifica que o cache K/V pode ser quantizado quando o Flash Attention está ativado, e que o formato q8_0 utiliza aproximadamente metade da memória do formato f16 padrão. A configuração é global para a instância Ollama: aplica-se a todos os modelos servidos.

Linux: Flash Attention e cache K/V em q8_0
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

Faça testes com medições: carregue o modelo, preencha um contexto comparável ao seu uso real e verifique com ollama ps se a execução permanece 100% na GPU. Se o modelo exceder a capacidade da GPU, a solução mais barata é quase sempre reduzir a janela de contexto, antes de mudar de modelo ou de placa. O guia sobre a janela de contexto explica como ajustá-la.

#2080 Ti, 3060 12 GB, 5060 Ti 16 GB: qual a escolha?

Geração com Llama 2 7B Q4_0 (tabela pública do llama.cpp)
PlacaMemóriaGeração (tok/s)Leitura do prompt (tok/s)
RTX 3060 12 GB12 GB75,62 138
RTX 5060 Ti 16 GB16 GB90,93 737
RTX 2080 Ti11 GB107,52 891
RTX 3080 10 GB10 GB139,75 014

A 2080 Ti gera cerca de 42% mais rápido que a 3060 de 12 GB, e até mais rápido que a RTX 5060 Ti de 16 GB, cujo barramento de 128 bits limita o desempenho. Em termos de memória, porém, a 2080 Ti fica atrás das duas: 11 GB contra 12 e 16 GB, respectivamente. A escolha depende, portanto, do modelo desejado. Para um modelo de 12B em Q4, a 2080 Ti é suficiente e continua sendo a mais rápida das três. Para um modelo de 20 bilhões de parâmetros ou mais, ou um contexto muito longo, são necessários 16 GB e a placa de nova geração se torna a melhor opção. Os preços mudam toda semana; o acompanhamento no site mostra o preço por GB de VRAM.

Pergunta 1: qual modelo você deseja?
Um modelo de 8 a 12B: mantenha ou compre a 2080 Ti. Um modelo de 20B ou mais: procure uma placa com 16 GB.
Pergunta 2: qual comprimento de contexto?
Alguns milhares de tokens: 11 GB são suficientes. Dezenas de milhares: a margem será insuficiente.
Pergunta 3: qual é o orçamento para energia elétrica?
Compare o consumo indicado na ficha técnica do seu modelo de placa com o das placas recentes, que são mais econômicas a uma velocidade comparável.

#Suporte à arquitetura Turing: o que está confirmado e o que não está

Turing é hoje a arquitetura mínima compatível com CUDA 13: as notas de versão indicam que o suporte às arquiteturas anteriores (Maxwell, Volta, Pascal) foi abandonado em suas bibliotecas. Isso significa que a 2080 Ti é compatível, mas também que é uma das placas mais antigas ainda incluídas. Nenhuma fonte consultada anuncia o fim do suporte a Turing; por outro lado, as novidades de hardware das gerações recentes (formatos de cálculo mais econômicos, por exemplo) nunca estarão disponíveis nessa arquitetura. Para llama.cpp e Ollama com modelos GGUF clássicos, isso não é um obstáculo.

#Veredito 2026

Mantenha-a se
Você já tem essa placa: os 11 GB e os 107 tokens por segundo em um modelo 7B fazem dela uma placa mais útil para IA do que muitas placas recentes de 8 GB.
Compre usada se
O preço é significativamente inferior ao de uma placa de 12 a 16 GB, e seu alvo é um modelo de 8 ou 12B. Verifique o estado dos ventiladores e a garantia; essas placas têm vários anos de uso.
Aumente para 16 GB se
Você busca um modelo de 20 bilhões ou mais, ou um contexto de dezenas de milhares de tokens.

#Perguntas frequentes

Perguntas frequentes
A RTX 2080 Ti ainda é relevante para um LLM em 2026?+
Sim, principalmente por seus 11 GB de memória. Ela roda um 12B em Q4 como Gemma 4 12B (7 GB) e um 8B em Q8, o que placas de 8 GB não permitem. No teste público do llama.cpp, ela gera 107 tokens por segundo em um 7B em Q4_0, uma velocidade muito confortável.
RTX 2080 Ti ou RTX 3060 12 GB para um LLM?+
A 2080 Ti gera cerca de 42% mais rápido (107,5 contra 75,6 tokens por segundo), a 3060 oferece 1 GB a mais de memória e consome menos. Para um 12B em Q4, as duas são suficientes e a 2080 Ti é mais rápida. A 3060 de 12 GB se justifica principalmente pelo preço e pelo consumo mais baixos.
Quantos tokens por segundo em uma RTX 2080 Ti?+
A tabela pública do llama.cpp indica 107,5 tokens por segundo para o Llama 2 7B em Q4_0. Um modelo mais pesado será mais lento, em uma proporção aproximada: cerca de 89 tokens por segundo para um 8B de 4,6 GB e 59 para um 12B de 7 GB, segundo uma estimativa teórica. Um contexto longo reduz ainda mais esses valores.
A RTX 2080 Ti suporta o Flash Attention?+
Sim: a tabela do llama.cpp contém um resultado com Flash Attention para a 2080 Ti, a 109,2 tokens por segundo em vez de 107,5. O Ollama ativa automaticamente quando a placa o permite e você pode forçar com OLLAMA_FLASH_ATTENTION=1. O principal benefício é a economia de memória em contextos longos.
Como saber se o meu modelo cabe inteiramente na placa?+
Execute ollama ps: a coluna Processor exibe 100% GPU quando o modelo está totalmente carregado na placa. Uma proporção como 48%/52% CPU/GPU indica que o carregamento está dividido entre a placa e a RAM, causando uma queda de velocidade. Nesse caso, reduza o contexto, quantize o cache K/V ou escolha um modelo mais leve.
A RTX 2080 Ti corre o risco de não ser mais suportada?+
Nenhuma fonte consultada anuncia o fim do suporte. O Ollama lista a placa entre aquelas com capacidade de computação 7.5 que exigem um driver 550 ou mais recente, e o CUDA 13 estabelece Turing como a geração mínima compatível. Acompanhe as notas de versão a cada atualização principal do CUDA: é lá que a retirada do suporte seria anunciada.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.