Iniciante 11 minGTX 10

Qual LLM no GTX 1080 Ti (11 GB) ?

Resposta direta

Sim: a GTX 1080 Ti (11 GB, 484 GB/s) continua sendo uma das melhores placas Pascal para um LLM local. O benchmark público do llama.cpp registra 62,49 tokens/s na geração com um Llama 2 7B em Q4_0, correspondendo ao nível de uma RTX 2060 Super, com 3 GB a mais de memória. Ela suporta um 8B ou um 9B em Q4 com margem, e um 12B com contexto modesto. Seu futuro em termos de suporte de software, no entanto, é limitado: a arquitetura Pascal foi removida do CUDA 13.

A GTX 1080 Ti foi lançada em março de 2017 com 11 GB de GDDR5X em um barramento de 352 bits, uma capacidade que foi rara por muito tempo e que ainda lhe dá vantagem sobre placas de 8 GB. Este guia quantifica o que essa memória permite hoje, apresenta o que dizem as medições públicas e corrige uma ideia comum: o FP16 de uma placa Pascal não é “duas vezes mais lento”, é quase inutilizável, mas isso importa pouco para modelos quantizados.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux
Hardware recomendado

Boa relação custo-benefício para IA local: um GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).

Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.

Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Orçamento apertado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#A GTX 1080 Ti em 2026: o que ela tem, o que não tem

A GTX 1080 Ti é uma placa Pascal (chip GP102) com 3 584 núcleos CUDA, 11 GB de GDDR5X e 484 GB/s de largura de banda, com uma potência de 250 W. No banco de testes público do llama.cpp, ela produz 62,49 tokens/s em geração e 1 084,41 tokens/s na leitura do prompt em um Llama 2 7B em Q4_0. Esses resultados a colocam no nível de uma RTX 2060 Super para geração, com 3 GB a mais: é essa capacidade, mais do que a velocidade, que ainda justifica o interesse nela.

Características (Wikipédia, GeForce 10 series)
ElementoValor
ChipGP102-350, Pascal
Núcleos CUDA3 584
Memória11 GB GDDR5X, barramento de 352 bits
Largura de banda484 GB/s
Poder computacional FP3210 609 GFLOPS
Poder computacional FP16166 GFLOPS
Potência de projeto térmico (TDP)250 W

A tabela já contém a informação mais importante: o FP16 equivale a aproximadamente 1/64 do FP32 nesta placa. O parágrafo seguinte explica por que isso não prejudica tanto quanto se imagina.

#Os limites de Pascal, o que importa e o que não importa

Três limitações são reais. A primeira é a ausência de Tensor Cores, as unidades de cálculo matricial que surgiram com Volta e Turing: elas aceleram a leitura do prompt e o treinamento, mas não a geração, que depende da memória. A segunda é o FP16, com desempenho ridiculamente baixo nas GPUs Pascal voltadas ao consumidor (cerca de 166 GFLOPS contra 10.609 em FP32): motores como llama.cpp contornam o problema fazendo os cálculos dos modelos quantizados com números inteiros. A terceira é o fim do suporte de software, tratado mais abaixo.

Duas afirmações frequentemente repetidas são falsas. O FP16 não é apenas duas vezes mais lento, é sessenta vezes mais lento. E o Flash Attention não é exclusivo para Tensor Cores: o benchmark llama.cpp executa a 1080 Ti com Flash Attention ativado, a 1 138,14 tokens/s na leitura do prompt e 61,38 tokens/s na geração, contra 1 084,41 e 62,49 sem. O ganho é pequeno na taxa de transferência, mas a função está disponível e reduz a memória do contexto.

!
Sem FP8 nem FP4
Os formatos recentes de quantização em hardware (FP8, FP4) exigem placas mais recentes. Na 1080 Ti, use as quantizações GGUF clássicas (Q4_K_M, Q5_K_M, Q8_0), que funcionam com cálculos com números inteiros.

#O que 11 GB permitem: a tabela de decisão

A referência do site coloca um modelo 8B em Q4 em torno de 5 GB e um 14B em torno de 9 GB, sem contar o cache KV. Com 11 GB, um 12B deixa 4 GB de margem e um 14B apenas 2 GB. A tabela aplica o rendimento observado na bancada de testes (49% do limite teórico de 484 GB/s, ou seja, 62,49 tokens/s para 3,82 GB de pesos) aos modelos comuns: são projeções, não medições.

Modelos em 11 GB, limite teórico e projeção com eficiência de 49 %
Modelo (Q4)Tamanho do modeloMargem com 11 GBLimite de 484 GB/sProjeção
Granite 4.2 8B4,6 GB6,4 GB105 tokens/scerca de 51 tokens/s
Qwen3.5 9B6 GB5 GB81 tokens/scerca de 40 tokens/s
Gemma 4 12B7 GB4 GB69 tokens/saproximadamente 34 tokens/s
Phi-4 14B9 GB2 GB54 tokens/saproximadamente 26 tokens/s, contexto curto
Gemma 4 26B-A4B (MoE)16 GBnegativaexcede a memória da GPUfora de alcance

A faixa mais interessante é a de 12B: é o maior modelo que ainda roda com folga, com um contexto de vários milhares de tokens. Em uma placa de 8 GB, esse mesmo modelo deixa apenas cerca de 1 GB livre e exige uma redução drástica do contexto. Acima disso, um modelo de 14B em Q4 cabe, mas sem margem, e um modelo de 30 bilhões de parâmetros não cabe.

#O que dizem os benchmarks públicos

QuelLLM não testa essa placa. O teste de desempenho apresentado na discussão "Performance of llama.cpp on Nvidia CUDA" compara todas as placas com o mesmo modelo, o que permite situar a 1080 Ti em relação às placas próximas dela.

Bancada de testes com llama.cpp CUDA, Llama 2 7B Q4_0, sem Flash Attention
PlacaMemóriaPrompt (pp512)Geração (tg128)
GTX 1080 Ti11 GB GDDR5X, 352 bits1 084,41 tokens/s62,49 tokens/s
Tesla P40 (Pascal)24 GB GDDR5, 384 bits1 007,42 tokens/s54,74 tokens/s
RTX 2060 Super8 GB GDDR6, 256 bits1 420,24 tokens/s60,04 tokens/s
RTX 306012 GB GDDR6, 192 bits2 137,50 tokens/s75,57 tokens/s
RTX 2080 Ti11 GB GDDR6, 352 bits2 890,66 tokens/s107,51 tokens/s

Três leituras se destacam. Na geração, a 1080 Ti iguala a RTX 2060 Super e fica 17% atrás de uma RTX 3060 de 12 GB. Na leitura do prompt, a diferença aumenta: a RTX 3060 quase dobra seu desempenho, e a RTX 2080 Ti, de mesma capacidade, supera-a em 2,7 vezes. Por fim, a Tesla P40, uma placa Pascal de 24 GB, atinge 54,74 tokens/s: ela mostra que a capacidade de 24 GB é alcançável nessa arquitetura, com uma taxa inferior à da 1080 Ti.

i
Geração versus leitura do prompt
Para conversas com mensagens curtas, a geração predomina e a 1080 Ti mantém um bom desempenho. Para resumir documentos longos ou usar RAG, a leitura do prompt conta: nessa etapa, as placas Turing e Ampere têm uma vantagem de 2 a 3 vezes.

#Aproveitar os 11 GB: usar uma quantização menos agressiva

Uma vantagem específica dos 11 GB é a possibilidade de aumentar a qualidade em vez do tamanho. O catálogo QuelLLM indica para um Granite 4.2 8B: 4,6 GB em Q4, 6 GB em Q5 e 9 GB em Q8. Com 8 GB, apenas o Q4 deixa margem. Com 11 GB, o Q5 (6 GB) ainda deixa bastante folga, e o Q8 (9 GB) cabe com um contexto curto.

Granite 4.2 8B dependendo da quantização, em 11 GB
QuantizaçãoTamanho do modeloMargemLimite de 484 GB/s
Q44,6 GB6,4 GB105 tokens/s
Q56 GB5 GB81 tokens/s
Q89 GB2 GB54 tokens/s

A relação entre precisão e velocidade é clara: cada nível de quantização reduz os erros do modelo, mas torna a geração mais lenta, pois mais pesos são relidos a cada token. Para conversas comuns, o Q5 é um bom ponto de equilíbrio; o Q8 se justifica pela precisão (extração, código) quando a taxa de geração importa pouco. O guia de quantização detalha a diferença de qualidade.

#Duas placas para 22 GB: possível, mas é preciso verificar

O benchmark do llama.cpp indica, em suas instruções, que os colaboradores com várias GPUs devem forçar o uso de uma única GPU com -sm none -mg, a menos que o modelo seja grande demais para a VRAM: o motor realmente distribui um modelo entre várias placas. Duas GTX 1080 Ti ofereceriam 22 GB para os pesos, o suficiente para acomodar um modelo de 32 bilhões de parâmetros em Q4 (19 a 20 GB segundo a referência do site), sem margem para o contexto.

A distribuição não soma as velocidades: as camadas são divididas entre as placas e transitam pelo barramento PCIe, o que limita o ganho. Essa configuração também exige um gabinete, uma fonte de alimentação e uma placa-mãe adequados, e dobra a exposição ao fim do suporte à arquitetura Pascal. Para um projeto de 24 GB, compare primeiro o custo de uma única placa mais recente.

#Instalar e verificar em quatro etapas

  1. 01
    Verificar o driver
    Execute nvidia-smi. Para placas com capacidade computacional de 5.0 a 6.2, incluindo a GTX 1080 Ti, a documentação do Ollama exige um driver 570 ou mais recente.
  2. 02
    Instalar Ollama
    Siga o guia de instalação do seu sistema. Ollama reconhece a placa como GTX 1080 Ti (compute capability 6.1) na sua lista oficial.
  3. 03
    Escolher um modelo adequado
    Comece com um modelo de 8B em Q4 para validar o fluxo de execução, depois teste um modelo de 12B com um contexto de 4.096 tokens.
  4. 04
    Verificar o posicionamento
    Execute ollama ps: a coluna PROCESSOR deve indicar 100% GPU. Caso contrário, reduza o contexto ou o tamanho do modelo.

Se um carregamento falhar, não procure uma variável incomum para contornar o problema: o Ollama ativa o Flash Attention automaticamente quando o motor e a placa oferecem suporte a ele, e a variável documentada é OLLAMA_FLASH_ATTENTION (1 para forçar, 0 para desativar). O guia de solução de problemas detalha os erros comuns.

#Fim da vida útil do Pascal: o que é preciso planejar

As notas de versão do CUDA 13 indicam que Maxwell, Pascal e Volta não são mais suportados. A Wikipédia informa que a NVIDIA encerrou em dezembro de 2025 o suporte Game Ready dessas arquiteturas, com atualizações de segurança até outubro de 2028. Atualmente, a GTX 1080 Ti funciona com Ollama e um driver 570 ou mais recente: o risco é que os futuros motores de inferência passem a funcionar apenas com CUDA 13. Anote suas versões de driver e de Ollama antes de qualquer atualização.

#Veredito: manter, sim; comprar, com condições

Decisão de acordo com a sua situação
Sua situaçãoRecomendação
Você já tem uma 1080 TiManter a placa: modelos de 8–12B rodam com folga, 62 tokens/s no benchmark
Você quer um 12B com contexto sem gastarEla é adequada: 11 GB, margem de 4 GB
Você trabalha com documentos longos ou RAGUma placa Ampere ou Turing lê o prompt 2 a 3 vezes mais rápido
Você procura uma compra que dureOptar por Turing ou uma arquitetura mais recente: o CUDA 13 não tem mais Pascal como alvo
Você quer 16 GB ou maisMudar de categoria: a 1080 Ti tem um limite de 11 GB

Para comparar as opções atuais sem listar preços que mudam semanalmente, as páginas do site indicam os modelos adequados para cada capacidade de memória e remetem à página de preços das placas gráficas.

FAQ
A GTX 1080 Ti ainda consegue executar um LLM em 2026?+
Sim. O benchmark público do llama.cpp mede 62,49 tokens/s em um 7B em Q4_0, e os 11 GB da placa acomodam um 8B ou um 9B com margem, além de um 12B com um contexto modesto. Ela continua sendo uma opção relevante enquanto as ferramentas oferecerem suporte a Pascal.
GTX 1080 Ti ou RTX 2060 Super para um LLM?+
Para a geração, elas têm desempenho equivalente: 62,49 contra 60,04 tokens/s no benchmark. A 1080 Ti tem 3 GB a mais de memória, o que conta para um 12B; a 2060 Super lê o prompt mais rápido (1 420 contra 1 084 tokens/s) e continua tendo suporte do CUDA 13.
A GTX 1080 Ti é mais lenta que uma RTX 3060 para um LLM?+
Sim, 17% mais lenta na geração (62,49 contra 75,57 tokens/s) e quase metade mais lenta na leitura do prompt (1 084 contra 2 137 tokens/s). A 3060 tem apenas 12 GB contra 11: a vantagem de capacidade é mínima. A 3060 ganha principalmente por ter suporte de software por mais tempo.
A 1080 Ti é compatível com Flash Attention?+
Sim. O teste do llama.cpp mede o desempenho dela com Flash Attention em 1.138,14 tokens/s na leitura do prompt e 61,38 na geração. O ganho de velocidade é pequeno, mas a função reduz o uso de memória do contexto. O Ollama a ativa automaticamente quando a placa oferece suporte a ela.
Qual driver é necessário para a GTX 1080 Ti com Ollama?+
A documentação de Ollama exige um driver NVIDIA 570 ou mais recente para placas com compute capability de 5.0 a 6.2, incluindo a GTX 1080 Ti. Verifique sua versão com nvidia-smi antes de instalar. A NVIDIA prevê atualizações de segurança para a branch 580 até outubro de 2028, mas não novas otimizações.
Quando é preciso substituir a GTX 1080 Ti?+
Quando uma ferramenta de que você precisa deixar de oferecer suporte ao Pascal, ou quando seus usos exigirem mais de 11 GB ou uma leitura rápida do prompt, como no caso de documentos longos e RAG. O CUDA 13 já removeu o suporte ao Pascal: esse é o sinal a observar a cada atualização do Ollama ou do llama.cpp.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.