Qual LLM em GTX 1060 (6 GB) ?
Sim, uma GTX 1060 de 6 GB ainda consegue rodar um LLM local em 2026, desde que você escolha modelos de 2 a 8 bilhões de parâmetros em Q4 e tenha paciência. O benchmark público do llama.cpp mede 27,79 tokens/s em um modelo 7B Q4_0: um ritmo que permite acompanhar a leitura em conversas, mas lento demais para agentes ou documentos longos. Os 6 GB são o verdadeiro limite, e a placa agora depende de drivers em fim de vida.
A GTX 1060 foi lançada em julho de 2016: é uma placa Pascal com 6 GB de GDDR5 e barramento de 192 bits, a placa de entrada mais comum nos PCs gamers da década passada. Este guia explica o que ela consegue rodar hoje, com quais taxas de processamento medidas por terceiros, o que não cabe na memória da placa e em que momento se torna mais razoável trocar de placa do que insistir.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Boa relação custo-benefício para IA local: um GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.
Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Orçamento apertado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#A GTX 1060 de 6 GB em 2026
A GTX 1060 de 6 GB pode ser usada para um LLM local sob três condições: um modelo cujos pesos em Q4 fiquem abaixo de cerca de 4,5 GB, um contexto curto e a aceitação de uma velocidade de aproximadamente 25 a 30 tokens/s em um modelo de 7B. O ranking público de desempenho do llama.cpp em CUDA indica 27,79 tokens/s na geração para um Llama 2 7B em Q4_0 (3,56 GiB), ou seja, um texto que aparece um pouco mais rápido do que você consegue ler. Acima de 8 bilhões de parâmetros, ou assim que você solicita um contexto longo, os 6 GB deixam de ser suficientes e parte do modelo passa a usar a RAM do sistema, o que derruba a velocidade.
- Arquitetura
- Pascal GP106, lançada em 19 de julho de 2016, 1.280 núcleos CUDA (configuração 1280:80:48).
- Memória
- 6 GB de GDDR5 em um barramento de 192 bits, ou seja, 192 GB/s com memória a 8 Gbit/s; existe uma variante a 9 Gbit/s, com 216 GB/s.
- Software
- Compute capability 6.1: ainda reconhecida pelo Ollama, mas com um driver 570 ou mais recente.
- O que está faltando
- Sem Tensor Cores: os ganhos das placas recentes no cálculo matricial não se aplicam.
#Qual GTX 1060 você tem: 3 GB, 5 GB, 6 GB
O nome GTX 1060 abrange várias placas diferentes, e a ficha técnica da placa importa mais do que seu nome. Apenas a versão de 6 GB é realmente adequada para LLMs; a versão de 3 GB nem sequer tem os mesmos núcleos.
| Variante | Núcleos CUDA | Memória | Barramento |
|---|---|---|---|
| GTX 1060 3 GB | 1 152 | 3 GB | 192 bits |
| GTX 1060 5 GB (China, final de 2017) | 1.280 (40 ROP) | 5 GB | 160 bits |
| GTX 1060 6 GB | 1 280 | 6 GB | 192 bits |
| GTX 1060 6 GB GDDR5X (2018) | GP104 reciclada | 6 GB | 192 bits |
Na versão de 3 GB, um modelo 3B em Q4 (cerca de 2 GB de pesos) deixa apenas 1 GB para o cache KV e o sistema: é um brinquedo. Na versão de 5 GB, a margem é mais apertada do que na de 6 GB. Se você estiver em dúvida sobre a compra, não escolha nenhuma das duas.
#O que realmente roda com 6 GB
A pergunta útil não é 'qual modelo cabe em 6 GB', mas 'qual modelo cabe com contexto e margem para o sistema'. O ponto de referência do site: um modelo de 7-8B em Q4 pesa cerca de 5 GB, um de 3B cerca de 2 GB, um de 14B cerca de 9 GB, considerando apenas os pesos. A isso se somam o cache KV, que aumenta com o comprimento da conversa, e o espaço reservado pelo driver. A tabela abaixo cruza o tamanho dos pesos em Q4 (catálogo QuelLLM) com o limite teórico de geração nessa placa.
| Modelo (Q4) | Tamanho do modelo | Margem de segurança de 6 GB | Limite teórica |
|---|---|---|---|
| Gemma 4 2B | 1,2 GB | 4,8 GB | 160 tokens/s |
| Granite 4.1 3B | 2 GB | 4 GB | 96 tokens/s |
| Phi-4 Mini 3,8B | 3 GB | 3 GB | 64 tokens/s |
| Granite 4.2 8B | 4,6 GB | 1,4 GB | 42 tokens/s |
| Qwen3.5 9B | 6 GB | nenhuma | excede a memória da GPU |
| Gemma 4 12B / Phi-4 14B | 7 a 9 GB | negativa | excede a memória da GPU |
O limite teórico é otimista: a geração de um token exige reler todos os pesos ativos, portanto a taxa de geração não pode ultrapassar a largura de banda dividida pelo tamanho do modelo. A taxa real é menor, como mostra a seção seguinte.
Na prática, a faixa confortável está entre 3 e 4 bilhões de parâmetros: um modelo desse tamanho deixa pelo menos 3 GB para o contexto, funciona sem problemas no GPU e responde sem atraso significativo. Os modelos de 7 a 8 bilhões ainda são possíveis para trocas curtas, mas apenas um documento colado na conversa já saturará a placa. Para tratamento de arquivos longos, é melhor usar outro hardware.
#O que os benchmarks públicos medem
Nenhuma das velocidades apresentadas neste guia foi medida pelo QuelLLM. Os únicos números citados vêm de um benchmark público: a discussão “Performance of llama.cpp on Nvidia CUDA” no repositório llama.cpp, em que cada colaborador executa llama-bench no mesmo modelo, Llama 2 7B em Q4_0. Essa discussão informa, para essa placa, 416,85 tokens/s no processamento do prompt (pp512) e 27,79 tokens/s na geração (tg128).
| Placa | Largura de banda | Geração (tg128) | Proporção do limite máximo |
|---|---|---|---|
| GTX 1060 6 GB | 192 GB/s | 27,79 tokens/s | 55 % |
| GTX 1070 Ti 8 GB | 256 GB/s | 37,82 tokens/s | 56 % |
| GTX 1660 6 GB | 192 GB/s | 41,35 tokens/s | 82 % |
| GTX 1080 Ti 11 GB | 484 GB/s | 62,49 tokens/s | 49 % |
Duas conclusões se destacam. Primeiro, a 1060 atinge um pouco mais da metade do seu limite teórico. Depois, a GTX 1660, que possui a mesma largura de banda de 192 GB/s, alcança 41,35 tokens/s: a arquitetura Turing aproveita muito melhor a mesma memória. Com a mesma largura de banda, uma placa Pascal continua sendo, portanto, aproximadamente um terço mais lenta que uma Turing. Para um modelo Granite 4.2 8B em Q4 (4,6 GB), a estimativa por simples proporcionalidade (27,79 × 3,82 ÷ 4,6) dá cerca de 23 tokens/s: trata-se de um cálculo, não de uma medição, e a penalidade do contexto se soma a isso.
#Com 6 GB, o fator decisivo é o contexto, não o modelo
Por padrão, Ollama usa uma janela de 4 096 tokens, que pode ser alterada com a variável OLLAMA_CONTEXT_LENGTH. Quanto maior a janela, mais memória o cache KV ocupa, e em 6 GB a margem é estreita. Um Granite 4.2 8B em Q4 deixa aproximadamente 1,4 GB para o cache e o sistema. Passar de 4 096 para 32 768 tokens multiplica o cache KV por oito: nesta placa, o limite é atingido muito antes da janela máxima anunciada pelo modelo.
O método para manter tudo na GPU: manter o contexto curto, escolher um modelo menor em vez de uma quantização mais agressiva e verificar com o comando ollama ps se a coluna PROCESSOR exibe 100% GPU. Uma divisão entre CPU e GPU indica que o modelo excede a capacidade da VRAM: a taxa de geração despenca, porque a memória do sistema é muito mais lenta que a GDDR5 da placa.
A quantização do cache KV, que pode ser ativada com Flash Attention, reduz ainda mais o uso de memória: o guia dedicado detalha o ganho. O princípio continua o mesmo em qualquer placa: se o modelo e seu contexto não cabem juntos, reduza um dos dois.
#Drivers e CUDA: a data de validade do Pascal
A GTX 1060 ainda funciona, mas seu ambiente de software está se reduzindo. A documentação do Ollama especifica que as placas com compute capability de 5.0 a 6.2 exigem um driver NVIDIA 570 ou mais recente, e a GTX 1060 consta na lista de placas reconhecidas. Quanto à NVIDIA, as notas de versão do CUDA 13 indicam que o suporte a arquiteturas anteriores a Turing (Maxwell, Volta e Pascal) foi descontinuado: as novas ferramentas CUDA não têm mais sua placa como alvo.
Quanto aos drivers, a Wikipédia resume a situação: a NVIDIA encerrou em dezembro de 2025 o suporte Game Ready para Maxwell, Pascal e Volta, a série 580 é a última a oferecer suporte a essas arquiteturas, e estão previstas atualizações de segurança até outubro de 2028. Na prática, a placa não receberá mais otimizações nem suporte de compatibilidade com futuras versões de software.
| Componente | Situação para a GTX 1060 |
|---|---|
| Ollama | Compatível com um driver 570 ou superior (lista oficial de compatibilidade) |
| CUDA Toolkit recente | Suporte a Pascal removido a partir do CUDA 13: optar por builds do CUDA 12 |
| Driver NVIDIA | Branch 580, últimas atualizações de segurança até outubro de 2028 |
| Novos mecanismos e novas otimizações | Risco crescente de incompatibilidade: verifique a cada atualização |
#Instalar e verificar em quatro etapas
- 01Verificar o driverExecute nvidia-smi: a versão do driver deve ser 570 ou superior. Tanto no Windows quanto no Linux, instale a série 580 se estiver abaixo disso.
- 02Instalar OllamaSiga o guia de instalação do seu sistema e depois baixe um modelo pequeno (2 a 4 GB) antes de tentar um 8B.
- 03Verificar o posicionamentoInicie uma conversa e depois execute ollama ps em um segundo terminal: a coluna PROCESSOR deve indicar 100% GPU.
- 04AjustarSe a taxa de geração for muito baixa ou se o processador participar do processamento, reduza o contexto ou mude para um modelo menor.
#Veredito: manter, comprar ou substituir
Se a placa já está no seu PC, vale dedicar uma noite a testá-la: ela funciona bem para conversas curtas, reformulação, tradução ou um pequeno assistente local com 3 a 4 bilhões de parâmetros. Se você pensa em comprá-la para IA, a resposta é não: com a mesma capacidade de memória, uma placa Turing ou mais recente oferece maior desempenho com a mesma largura de banda, melhor compatibilidade com software e suporte por muito mais tempo.
| Sua situação | Recomendação |
|---|---|
| Você já possui a placa e quer experimentar | Sim: modelos de 2 a 4 GB, contexto curto |
| Você quer rodar um 8B com folga e 8.000 tokens de contexto | Não: trocar por uma placa de 8 GB ou mais |
| Você quer modelos de 12 a 14 bilhões de parâmetros | Não: buscar 12 GB ou mais |
| Você está pensando em comprar uma usada | Não: comparar placas Turing e Ampere de entrada |
Para comparar sem consultar os preços aqui, que mudam toda semana, consulte a página de preços das placas de vídeo do site e o guia de modelos adequados para 6 GB de VRAM, para ver o que outras placas desse tamanho permitem.
- Comparar os preços de GPU para IA
- Quais modelos para 6 GB de VRAM, considerando todas as placas
- Qual LLM no RTX 3050
- VRAM: quanto é necessário para a IA
- Fonte: documentação do Ollama, hardware NVIDIA suportado
- Fonte: benchmark público llama.cpp em CUDA
- Fonte: notas de versão do CUDA Toolkit
- Fonte: série GeForce 10, características e fim do suporte
A GTX 1060 de 6 GB consegue rodar um modelo 8B?+
GTX 1060 3 GB ou 6 GB para um LLM?+
Quantos tokens por segundo em uma GTX 1060?+
Ollama ainda funciona em uma GTX 1060 em 2026?+
Vale a pena comprar uma GTX 1060 usada para IA?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.