Qual LLM na GTX 1070 / 1080 (8 GB) ?
Sim: uma GTX 1070, 1070 Ti ou 1080 de 8 GB consegue rodar sem problemas um modelo de 7 a 9 bilhões de parâmetros em Q4, com um contexto razoável. O benchmark público do llama.cpp mede 37,82 tokens/s para uma GTX 1070 Ti em um modelo 7B Q4_0; a 1080, com memória mais rápida, deve ter um desempenho melhor, embora não haja medição direta. Acima de 9 bilhões de parâmetros, os 8 GB passam a ser um fator limitante, e a arquitetura Pascal não tem mais futuro em termos de software.
As GTX 1070 (junho de 2016), 1070 Ti (novembro de 2017) e 1080 (maio de 2016) compartilham o mesmo chip GP104 e 8 GB de memória. Elas se tornaram as placas usadas mais atraentes para experimentar um LLM local sem gastar. Este guia quantifica o que a memória delas permite, o que as medições públicas dizem sobre sua velocidade e por que a data de fim do suporte à arquitetura Pascal pesa mais que o preço.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Boa relação custo-benefício para IA local: um GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.
Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Orçamento apertado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#GTX 1070, 1070 Ti, 1080: o que os diferencia para um LLM
Para um LLM, essas três placas têm a mesma capacidade, 8 GB, e se distinguem pela largura de banda da memória, que define a velocidade de geração. A 1070 e a 1070 Ti usam GDDR5 em 256 bits, ou seja, 256 GB/s; a 1080 atinge 320 GB/s com GDDR5X. Como um LLM relê todos os seus pesos a cada token, essa diferença de 25% se traduz quase diretamente em velocidade, muito mais do que os 2.560 núcleos da 1080 em comparação com os 1.920 da 1070. Nenhuma delas possui Tensor Cores: Pascal continua com o cálculo CUDA clássico.
| Placa | Núcleos CUDA | Memória | Largura de banda | Velocidade de geração medida (7B Q4_0) |
|---|---|---|---|---|
| GTX 1070 | 1 920 | 8 GB GDDR5 | 256 GB/s | não medida na bancada de testes |
| GTX 1070 Ti | 2 432 | 8 GB GDDR5 | 256 GB/s | 37,82 tokens/s |
| GTX 1080 | 2 560 | 8 GB GDDR5X | 320 GB/s | não medida na bancada de testes |
Uma GTX 1080 Ti, com 11 GB e 484 GB/s, pertence a outra categoria: ela tem sua própria página. Se a sua placa for uma 1080 Ti, leia o guia dedicado a ela em vez deste.
#O que 8 GB realmente permitem
O critério que importa é a relação entre os pesos e a memória disponível, já que o cache KV é acrescentado a isso. A referência do site coloca um 7-8B em Q4 em torno de 5 GB de pesos: em 8 GB, sobram cerca de 3 GB para o contexto e o sistema, uma margem real. Um 9B em Q4, com 6 GB, deixa 2 GB: é possível com um contexto curto. Com 12 bilhões de parâmetros, os pesos chegam a 7 GB: quase não sobra nada.
| Modelo (Q4) | Tamanho do modelo | Margem com 8 GB | Limite com largura de banda de 256 GB/s | Limite com largura de banda de 320 GB/s |
|---|---|---|---|---|
| Granite 4.1 3B | 2 GB | 6 GB | 128 tokens/s | 160 tokens/s |
| Granite 4.2 8B | 4,6 GB | 3,4 GB | 55 tokens/s | 70 tokens/s |
| Qwen3.5 9B | 6 GB | 2 GB | 43 tokens/s | 53 tokens/s |
| Gemma 4 12B | 7 GB | 1 GB | desaconselhado | desaconselhado |
| Phi-4 14B | 9 GB | negativa | excede a memória da GPU | excede a memória da GPU |
Um limite teórico nunca é atingido. Na bancada de testes pública, a GTX 1070 Ti atinge 37,82 tokens/s em um modelo de 3,56 GiB, ou seja, cerca de 56% do seu limite teórico de 256 GB/s. Ao aplicar esse mesmo rendimento aos modelos acima, um Granite 4.2 8B rodaria em torno de 30 tokens/s em uma 1070 Ti: trata-se de uma extrapolação proporcional, não de uma medição.
#O que dizem os benchmarks públicos
QuelLLM não testa essas placas. Os números vêm da discussão « Performance of llama.cpp on Nvidia CUDA » no repositório llama.cpp, em que cada colaborador executa llama-bench com Llama 2 7B em Q4_0 e todas as camadas na GPU. Nessa discussão, a GTX 1070 Ti apresenta 714,44 tokens/s no processamento do prompt e 37,82 tokens/s na geração.
Para as placas da mesma página que têm resultados medidos, a comparação é útil: a RTX 2060 Super, uma placa Turing de 8 GB com barramento de 256 bits, produz 60,04 tokens/s no mesmo teste, contra 37,82 para a 1070 Ti. Com largura de banda de memória semelhante, o ganho é de 59%. O teste explica melhor a diferença do que os núcleos ou o preço: a arquitetura Turing explora melhor sua memória.
| Placa | Memória | Prompt (pp512) | Geração (tg128) |
|---|---|---|---|
| GTX 1070 Ti | 8 GB GDDR5, 256 bits | 714,44 tokens/s | 37,82 tokens/s |
| RTX 2060 Super | 8 GB GDDR6, 256 bits | 1 420,24 tokens/s | 60,04 tokens/s |
| GTX 1080 Ti | 11 GB GDDR5X, 352 bits | 1 084,41 tokens/s | 62,49 tokens/s |
Esses números devem ser interpretados com três ressalvas. Cada linha do benchmark é uma contribuição individual: driver, sistema, refrigeração e fabricante da placa variam de um colaborador para outro, o que explica alguns pontos de diferença para um mesmo chip. O modelo de teste, um Llama 2 7B, é mais antigo e menor que os modelos atuais: serve como referência comum, não como previsão para um modelo específico. Por fim, a geração depende principalmente da memória, enquanto a leitura do prompt depende da capacidade de processamento: as duas colunas não dizem a mesma coisa.
#Estimar a GTX 1080 sem medição: método e limites
A 1080 não aparece nos testes. Para ter uma ideia, pode-se aplicar a razão entre as larguras de banda: 320 ÷ 256 = 1,25, ou seja, aproximadamente 47 tokens/s (37,82 × 1,25) se o rendimento permanecer igual ao da 1070 Ti. É uma hipótese plausível, não um resultado: os drivers, a versão do llama.cpp, a temperatura ou o resfriamento da placa fazem as taxas de geração variar significativamente.
Se você comprar uma placa usada para esse uso, peça ao vendedor uma captura de tela de um teste real ou execute você mesmo o llama-bench com o modelo usado no benchmark assim que receber a placa: o resultado pode ser comparado diretamente com a tabela pública.
#O contexto: para onde vão os 3 GB de margem
Com 8 GB, um Granite 4.2 8B em Q4 deixa cerca de 3,4 GB disponíveis. Essa reserva é compartilhada entre o cache KV, que cresce com cada token da conversa, os buffers de cálculo e o espaço ocupado pelo driver e pela exibição de imagens, caso a placa também controle seu monitor. O Ollama inicia com uma janela de 4.096 tokens, modificável pela variável OLLAMA_CONTEXT_LENGTH; dobrar a janela dobra o cache KV.
Uma regra de decisão simples: se você quiser trabalhar com documentos longos (16.000 tokens ou mais), escolha um modelo de 3 a 4 bilhões de parâmetros ou um 8B com cache KV quantizado. Se você trocar mensagens curtas, o 8B em Q4 é uma boa escolha. Em ambos os casos, verifique com ollama ps se o modelo está 100% carregado na GPU: a divisão com o processador indica que a margem se esgotou.
#Flash Attention no Pascal: útil ou não?
Uma crença comum é que o Flash Attention está reservado às placas com Tensor Cores. O benchmark do llama.cpp desmente isso: ele testa cada placa com e sem Flash Attention, e a GTX 1080 Ti, da geração Pascal, aparece nas duas tabelas. Com Flash Attention, ela passa de 1.084,41 para 1.138,14 tokens/s no processamento do prompt, ou seja, cerca de 5% a mais, e de 62,49 para 61,38 tokens/s na geração, ou seja, 2% a menos. O principal benefício do Flash Attention não é a velocidade, mas a memória: ele reduz o consumo de memória do contexto, o que faz diferença em 8 GB.
Ollama ativa o Flash Attention automaticamente quando o mecanismo e a placa são compatíveis; a variável OLLAMA_FLASH_ATTENTION=1 força sua ativação, e o valor 0 a desativa. A quantização do cache KV, que reduz ainda mais a memória do contexto, exige que o Flash Attention esteja ativado.
#Para que usar uma placa Pascal de 8 GB?
| Uso | Adequação | Ajuste recomendado |
|---|---|---|
| Chat, reformulação, tradução | Boa | Granite 4.2 8B em Q4, contexto de 4 096 tokens |
| Assistência à programação no editor | Razoável | Modelo de 7–8B, contexto médio, apenas um modelo carregado |
| Resumo de documentos longos | Limitada | Modelo de 3-4B ou cache KV quantizado |
| Pesquisa nos seus documentos (RAG) | Razoável | Modelo de 3 a 8B, trechos curtos, não 12B |
| Agentes com chamadas de ferramentas encadeadas | Fraco | Contexto demais e chamadas demais para 8 GB |
#Pascal: o suporte de software, o verdadeiro limite
O principal risco não vem da velocidade, mas do software. O Ollama exige um driver NVIDIA 570 ou mais recente para placas com compute capability de 5.0 a 6.2, e as GTX 1070 a 1080 estão incluídas. Mas as notas de versão do CUDA 13 indicam que Pascal foi removido, e a Wikipédia lembra que a NVIDIA encerrou o suporte Game Ready dessa geração em dezembro de 2025, com atualizações de segurança até outubro de 2028.
- Aujourd'hui
- Ollama e llama.cpp funcionam com um driver 570 ou superior e builds CUDA 12.
- Amanhã
- As novas funcionalidades e os novos motores terão o CUDA 13 como alvo: cada atualização pode remover o suporte à arquitetura Pascal.
- Segurança
- Há correções de segurança do driver até outubro de 2028, mas não há novas otimizações.
#É melhor uma 1070 Ti ou outra coisa?
Para um mesmo orçamento de compra de uma placa usada, a comparação se baseia em três critérios: memória (mínimo de 8 GB), geração da arquitetura (Turing ou mais recente para aproveitar o CUDA 13) e largura de banda. Sem citar preços, que mudam todas as semanas, veja como se posicionam as opções.
| Opção | Pontos fortes | Pontos fracos |
|---|---|---|
| GTX 1070 / 1070 Ti / 1080 (que você já possui) | Gratuita; roda modelos de 7–9B com folga | Pascal no fim do suporte, mais lenta com a mesma largura de banda |
| RTX 2060 Super (8 GB) | 60,04 tokens/s no benchmark, Turing, Tensor Cores | Ainda 8 GB |
| RTX 3050 (6 ou 8 GB) | Ampere, suporte de software de longa duração | Largura de banda limitada conforme a versão |
| Placa de 12 GB (RTX 3060 12 GB) | Margem para 12-14B e contexto longo | Orçamento maior |
- Qual LLM para a RTX 2060 / 2060 Super
- Qual LLM para RTX 3060 12 GB
- Quais modelos para 8 GB de VRAM, todas as placas
- Comparar os preços de GPU para IA
#Veredito: conhecer, sim; investir, não
Se você já tem uma GTX 1070, 1070 Ti ou 1080, ela é uma excelente porta de entrada: 8 GB são suficientes para um modelo de 8B em Q4, e a taxa de geração continua confortável para conversas. Se você pretende comprar, prefira uma placa de 8 GB com arquitetura Turing ou mais recente: com a mesma capacidade de memória, as taxas de geração são significativamente maiores e o suporte de software dura mais tempo.
Um último critério prático: o consumo. Essas placas são modelos de 150 a 180 W em jogos; durante a inferência, aquecem menos do que em jogos, mas um gabinete mal ventilado pode reduzir as taxas de geração. Verifique as temperaturas durante uma geração longa antes de concluir que a placa é lenta.
- Fonte: benchmark público llama.cpp em CUDA
- Fonte: documentação do Ollama, hardware NVIDIA suportado
- Fonte: GeForce 10 series, especificações
- Fonte: notas de versão do CUDA Toolkit
Uma GTX 1070 ou 1080 consegue rodar um modelo 8B?+
GTX 1070 ou GTX 1080 para um LLM local?+
Quantos tokens por segundo em uma GTX 1080?+
É possível executar o Qwen3.5 9B em uma GTX 1070?+
Vale a pena comprar uma GTX 1080 usada em 2026?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.