Qual LLM no GTX 1080 Ti (11 GB) ?
Sim: a GTX 1080 Ti (11 GB, 484 GB/s) continua sendo uma das melhores placas Pascal para um LLM local. O benchmark público do llama.cpp registra 62,49 tokens/s na geração com um Llama 2 7B em Q4_0, correspondendo ao nível de uma RTX 2060 Super, com 3 GB a mais de memória. Ela suporta um 8B ou um 9B em Q4 com margem, e um 12B com contexto modesto. Seu futuro em termos de suporte de software, no entanto, é limitado: a arquitetura Pascal foi removida do CUDA 13.
A GTX 1080 Ti foi lançada em março de 2017 com 11 GB de GDDR5X em um barramento de 352 bits, uma capacidade que foi rara por muito tempo e que ainda lhe dá vantagem sobre placas de 8 GB. Este guia quantifica o que essa memória permite hoje, apresenta o que dizem as medições públicas e corrige uma ideia comum: o FP16 de uma placa Pascal não é “duas vezes mais lento”, é quase inutilizável, mas isso importa pouco para modelos quantizados.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Boa relação custo-benefício para IA local: um GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.
Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Orçamento apertado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#A GTX 1080 Ti em 2026: o que ela tem, o que não tem
A GTX 1080 Ti é uma placa Pascal (chip GP102) com 3 584 núcleos CUDA, 11 GB de GDDR5X e 484 GB/s de largura de banda, com uma potência de 250 W. No banco de testes público do llama.cpp, ela produz 62,49 tokens/s em geração e 1 084,41 tokens/s na leitura do prompt em um Llama 2 7B em Q4_0. Esses resultados a colocam no nível de uma RTX 2060 Super para geração, com 3 GB a mais: é essa capacidade, mais do que a velocidade, que ainda justifica o interesse nela.
| Elemento | Valor |
|---|---|
| Chip | GP102-350, Pascal |
| Núcleos CUDA | 3 584 |
| Memória | 11 GB GDDR5X, barramento de 352 bits |
| Largura de banda | 484 GB/s |
| Poder computacional FP32 | 10 609 GFLOPS |
| Poder computacional FP16 | 166 GFLOPS |
| Potência de projeto térmico (TDP) | 250 W |
A tabela já contém a informação mais importante: o FP16 equivale a aproximadamente 1/64 do FP32 nesta placa. O parágrafo seguinte explica por que isso não prejudica tanto quanto se imagina.
#Os limites de Pascal, o que importa e o que não importa
Três limitações são reais. A primeira é a ausência de Tensor Cores, as unidades de cálculo matricial que surgiram com Volta e Turing: elas aceleram a leitura do prompt e o treinamento, mas não a geração, que depende da memória. A segunda é o FP16, com desempenho ridiculamente baixo nas GPUs Pascal voltadas ao consumidor (cerca de 166 GFLOPS contra 10.609 em FP32): motores como llama.cpp contornam o problema fazendo os cálculos dos modelos quantizados com números inteiros. A terceira é o fim do suporte de software, tratado mais abaixo.
Duas afirmações frequentemente repetidas são falsas. O FP16 não é apenas duas vezes mais lento, é sessenta vezes mais lento. E o Flash Attention não é exclusivo para Tensor Cores: o benchmark llama.cpp executa a 1080 Ti com Flash Attention ativado, a 1 138,14 tokens/s na leitura do prompt e 61,38 tokens/s na geração, contra 1 084,41 e 62,49 sem. O ganho é pequeno na taxa de transferência, mas a função está disponível e reduz a memória do contexto.
#O que 11 GB permitem: a tabela de decisão
A referência do site coloca um modelo 8B em Q4 em torno de 5 GB e um 14B em torno de 9 GB, sem contar o cache KV. Com 11 GB, um 12B deixa 4 GB de margem e um 14B apenas 2 GB. A tabela aplica o rendimento observado na bancada de testes (49% do limite teórico de 484 GB/s, ou seja, 62,49 tokens/s para 3,82 GB de pesos) aos modelos comuns: são projeções, não medições.
| Modelo (Q4) | Tamanho do modelo | Margem com 11 GB | Limite de 484 GB/s | Projeção |
|---|---|---|---|---|
| Granite 4.2 8B | 4,6 GB | 6,4 GB | 105 tokens/s | cerca de 51 tokens/s |
| Qwen3.5 9B | 6 GB | 5 GB | 81 tokens/s | cerca de 40 tokens/s |
| Gemma 4 12B | 7 GB | 4 GB | 69 tokens/s | aproximadamente 34 tokens/s |
| Phi-4 14B | 9 GB | 2 GB | 54 tokens/s | aproximadamente 26 tokens/s, contexto curto |
| Gemma 4 26B-A4B (MoE) | 16 GB | negativa | excede a memória da GPU | fora de alcance |
A faixa mais interessante é a de 12B: é o maior modelo que ainda roda com folga, com um contexto de vários milhares de tokens. Em uma placa de 8 GB, esse mesmo modelo deixa apenas cerca de 1 GB livre e exige uma redução drástica do contexto. Acima disso, um modelo de 14B em Q4 cabe, mas sem margem, e um modelo de 30 bilhões de parâmetros não cabe.
#O que dizem os benchmarks públicos
QuelLLM não testa essa placa. O teste de desempenho apresentado na discussão "Performance of llama.cpp on Nvidia CUDA" compara todas as placas com o mesmo modelo, o que permite situar a 1080 Ti em relação às placas próximas dela.
| Placa | Memória | Prompt (pp512) | Geração (tg128) |
|---|---|---|---|
| GTX 1080 Ti | 11 GB GDDR5X, 352 bits | 1 084,41 tokens/s | 62,49 tokens/s |
| Tesla P40 (Pascal) | 24 GB GDDR5, 384 bits | 1 007,42 tokens/s | 54,74 tokens/s |
| RTX 2060 Super | 8 GB GDDR6, 256 bits | 1 420,24 tokens/s | 60,04 tokens/s |
| RTX 3060 | 12 GB GDDR6, 192 bits | 2 137,50 tokens/s | 75,57 tokens/s |
| RTX 2080 Ti | 11 GB GDDR6, 352 bits | 2 890,66 tokens/s | 107,51 tokens/s |
Três leituras se destacam. Na geração, a 1080 Ti iguala a RTX 2060 Super e fica 17% atrás de uma RTX 3060 de 12 GB. Na leitura do prompt, a diferença aumenta: a RTX 3060 quase dobra seu desempenho, e a RTX 2080 Ti, de mesma capacidade, supera-a em 2,7 vezes. Por fim, a Tesla P40, uma placa Pascal de 24 GB, atinge 54,74 tokens/s: ela mostra que a capacidade de 24 GB é alcançável nessa arquitetura, com uma taxa inferior à da 1080 Ti.
#Aproveitar os 11 GB: usar uma quantização menos agressiva
Uma vantagem específica dos 11 GB é a possibilidade de aumentar a qualidade em vez do tamanho. O catálogo QuelLLM indica para um Granite 4.2 8B: 4,6 GB em Q4, 6 GB em Q5 e 9 GB em Q8. Com 8 GB, apenas o Q4 deixa margem. Com 11 GB, o Q5 (6 GB) ainda deixa bastante folga, e o Q8 (9 GB) cabe com um contexto curto.
| Quantização | Tamanho do modelo | Margem | Limite de 484 GB/s |
|---|---|---|---|
| Q4 | 4,6 GB | 6,4 GB | 105 tokens/s |
| Q5 | 6 GB | 5 GB | 81 tokens/s |
| Q8 | 9 GB | 2 GB | 54 tokens/s |
A relação entre precisão e velocidade é clara: cada nível de quantização reduz os erros do modelo, mas torna a geração mais lenta, pois mais pesos são relidos a cada token. Para conversas comuns, o Q5 é um bom ponto de equilíbrio; o Q8 se justifica pela precisão (extração, código) quando a taxa de geração importa pouco. O guia de quantização detalha a diferença de qualidade.
#Duas placas para 22 GB: possível, mas é preciso verificar
O benchmark do llama.cpp indica, em suas instruções, que os colaboradores com várias GPUs devem forçar o uso de uma única GPU com -sm none -mg, a menos que o modelo seja grande demais para a VRAM: o motor realmente distribui um modelo entre várias placas. Duas GTX 1080 Ti ofereceriam 22 GB para os pesos, o suficiente para acomodar um modelo de 32 bilhões de parâmetros em Q4 (19 a 20 GB segundo a referência do site), sem margem para o contexto.
A distribuição não soma as velocidades: as camadas são divididas entre as placas e transitam pelo barramento PCIe, o que limita o ganho. Essa configuração também exige um gabinete, uma fonte de alimentação e uma placa-mãe adequados, e dobra a exposição ao fim do suporte à arquitetura Pascal. Para um projeto de 24 GB, compare primeiro o custo de uma única placa mais recente.
#Instalar e verificar em quatro etapas
- 01Verificar o driverExecute nvidia-smi. Para placas com capacidade computacional de 5.0 a 6.2, incluindo a GTX 1080 Ti, a documentação do Ollama exige um driver 570 ou mais recente.
- 02Instalar OllamaSiga o guia de instalação do seu sistema. Ollama reconhece a placa como GTX 1080 Ti (compute capability 6.1) na sua lista oficial.
- 03Escolher um modelo adequadoComece com um modelo de 8B em Q4 para validar o fluxo de execução, depois teste um modelo de 12B com um contexto de 4.096 tokens.
- 04Verificar o posicionamentoExecute ollama ps: a coluna PROCESSOR deve indicar 100% GPU. Caso contrário, reduza o contexto ou o tamanho do modelo.
Se um carregamento falhar, não procure uma variável incomum para contornar o problema: o Ollama ativa o Flash Attention automaticamente quando o motor e a placa oferecem suporte a ele, e a variável documentada é OLLAMA_FLASH_ATTENTION (1 para forçar, 0 para desativar). O guia de solução de problemas detalha os erros comuns.
#Fim da vida útil do Pascal: o que é preciso planejar
As notas de versão do CUDA 13 indicam que Maxwell, Pascal e Volta não são mais suportados. A Wikipédia informa que a NVIDIA encerrou em dezembro de 2025 o suporte Game Ready dessas arquiteturas, com atualizações de segurança até outubro de 2028. Atualmente, a GTX 1080 Ti funciona com Ollama e um driver 570 ou mais recente: o risco é que os futuros motores de inferência passem a funcionar apenas com CUDA 13. Anote suas versões de driver e de Ollama antes de qualquer atualização.
#Veredito: manter, sim; comprar, com condições
| Sua situação | Recomendação |
|---|---|
| Você já tem uma 1080 Ti | Manter a placa: modelos de 8–12B rodam com folga, 62 tokens/s no benchmark |
| Você quer um 12B com contexto sem gastar | Ela é adequada: 11 GB, margem de 4 GB |
| Você trabalha com documentos longos ou RAG | Uma placa Ampere ou Turing lê o prompt 2 a 3 vezes mais rápido |
| Você procura uma compra que dure | Optar por Turing ou uma arquitetura mais recente: o CUDA 13 não tem mais Pascal como alvo |
| Você quer 16 GB ou mais | Mudar de categoria: a 1080 Ti tem um limite de 11 GB |
Para comparar as opções atuais sem listar preços que mudam semanalmente, as páginas do site indicam os modelos adequados para cada capacidade de memória e remetem à página de preços das placas gráficas.
- Qual LLM para RTX 3060 12 GB
- Qual LLM em RTX 2080 Ti (11 GB)
- Quais modelos para 12 GB de VRAM, em qualquer placa de vídeo
- Comparar os preços de GPU para IA
- Fonte: benchmark público llama.cpp em CUDA
- Fonte: documentação do Ollama, hardware NVIDIA suportado
- Fonte: GeForce 10 series, especificações
- Fonte: notas de versão do CUDA Toolkit
A GTX 1080 Ti ainda consegue executar um LLM em 2026?+
GTX 1080 Ti ou RTX 2060 Super para um LLM?+
A GTX 1080 Ti é mais lenta que uma RTX 3060 para um LLM?+
A 1080 Ti é compatível com Flash Attention?+
Qual driver é necessário para a GTX 1080 Ti com Ollama?+
Quando é preciso substituir a GTX 1080 Ti?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.