Iniciante 11 minGTX 10

Qual LLM em GTX 1060 (6 GB) ?

Resposta direta

Sim, uma GTX 1060 de 6 GB ainda consegue rodar um LLM local em 2026, desde que você escolha modelos de 2 a 8 bilhões de parâmetros em Q4 e tenha paciência. O benchmark público do llama.cpp mede 27,79 tokens/s em um modelo 7B Q4_0: um ritmo que permite acompanhar a leitura em conversas, mas lento demais para agentes ou documentos longos. Os 6 GB são o verdadeiro limite, e a placa agora depende de drivers em fim de vida.

A GTX 1060 foi lançada em julho de 2016: é uma placa Pascal com 6 GB de GDDR5 e barramento de 192 bits, a placa de entrada mais comum nos PCs gamers da década passada. Este guia explica o que ela consegue rodar hoje, com quais taxas de processamento medidas por terceiros, o que não cabe na memória da placa e em que momento se torna mais razoável trocar de placa do que insistir.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux
Hardware recomendado

Boa relação custo-benefício para IA local: um GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).

Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.

Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Orçamento apertado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#A GTX 1060 de 6 GB em 2026

A GTX 1060 de 6 GB pode ser usada para um LLM local sob três condições: um modelo cujos pesos em Q4 fiquem abaixo de cerca de 4,5 GB, um contexto curto e a aceitação de uma velocidade de aproximadamente 25 a 30 tokens/s em um modelo de 7B. O ranking público de desempenho do llama.cpp em CUDA indica 27,79 tokens/s na geração para um Llama 2 7B em Q4_0 (3,56 GiB), ou seja, um texto que aparece um pouco mais rápido do que você consegue ler. Acima de 8 bilhões de parâmetros, ou assim que você solicita um contexto longo, os 6 GB deixam de ser suficientes e parte do modelo passa a usar a RAM do sistema, o que derruba a velocidade.

Arquitetura
Pascal GP106, lançada em 19 de julho de 2016, 1.280 núcleos CUDA (configuração 1280:80:48).
Memória
6 GB de GDDR5 em um barramento de 192 bits, ou seja, 192 GB/s com memória a 8 Gbit/s; existe uma variante a 9 Gbit/s, com 216 GB/s.
Software
Compute capability 6.1: ainda reconhecida pelo Ollama, mas com um driver 570 ou mais recente.
O que está faltando
Sem Tensor Cores: os ganhos das placas recentes no cálculo matricial não se aplicam.

#Qual GTX 1060 você tem: 3 GB, 5 GB, 6 GB

O nome GTX 1060 abrange várias placas diferentes, e a ficha técnica da placa importa mais do que seu nome. Apenas a versão de 6 GB é realmente adequada para LLMs; a versão de 3 GB nem sequer tem os mesmos núcleos.

As variantes da GTX 1060 (de acordo com a tabela das GeForce 10 da Wikipédia)
VarianteNúcleos CUDAMemóriaBarramento
GTX 1060 3 GB1 1523 GB192 bits
GTX 1060 5 GB (China, final de 2017)1.280 (40 ROP)5 GB160 bits
GTX 1060 6 GB1 2806 GB192 bits
GTX 1060 6 GB GDDR5X (2018)GP104 reciclada6 GB192 bits

Na versão de 3 GB, um modelo 3B em Q4 (cerca de 2 GB de pesos) deixa apenas 1 GB para o cache KV e o sistema: é um brinquedo. Na versão de 5 GB, a margem é mais apertada do que na de 6 GB. Se você estiver em dúvida sobre a compra, não escolha nenhuma das duas.

#O que realmente roda com 6 GB

A pergunta útil não é 'qual modelo cabe em 6 GB', mas 'qual modelo cabe com contexto e margem para o sistema'. O ponto de referência do site: um modelo de 7-8B em Q4 pesa cerca de 5 GB, um de 3B cerca de 2 GB, um de 14B cerca de 9 GB, considerando apenas os pesos. A isso se somam o cache KV, que aumenta com o comprimento da conversa, e o espaço reservado pelo driver. A tabela abaixo cruza o tamanho dos pesos em Q4 (catálogo QuelLLM) com o limite teórico de geração nessa placa.

Modelos e 192 GB/s de largura de banda (teto teórico = largura de banda ÷ pesos, nunca uma medição)
Modelo (Q4)Tamanho do modeloMargem de segurança de 6 GBLimite teórica
Gemma 4 2B1,2 GB4,8 GB160 tokens/s
Granite 4.1 3B2 GB4 GB96 tokens/s
Phi-4 Mini 3,8B3 GB3 GB64 tokens/s
Granite 4.2 8B4,6 GB1,4 GB42 tokens/s
Qwen3.5 9B6 GBnenhumaexcede a memória da GPU
Gemma 4 12B / Phi-4 14B7 a 9 GBnegativaexcede a memória da GPU

O limite teórico é otimista: a geração de um token exige reler todos os pesos ativos, portanto a taxa de geração não pode ultrapassar a largura de banda dividida pelo tamanho do modelo. A taxa real é menor, como mostra a seção seguinte.

Na prática, a faixa confortável está entre 3 e 4 bilhões de parâmetros: um modelo desse tamanho deixa pelo menos 3 GB para o contexto, funciona sem problemas no GPU e responde sem atraso significativo. Os modelos de 7 a 8 bilhões ainda são possíveis para trocas curtas, mas apenas um documento colado na conversa já saturará a placa. Para tratamento de arquivos longos, é melhor usar outro hardware.

#O que os benchmarks públicos medem

Nenhuma das velocidades apresentadas neste guia foi medida pelo QuelLLM. Os únicos números citados vêm de um benchmark público: a discussão “Performance of llama.cpp on Nvidia CUDA” no repositório llama.cpp, em que cada colaborador executa llama-bench no mesmo modelo, Llama 2 7B em Q4_0. Essa discussão informa, para essa placa, 416,85 tokens/s no processamento do prompt (pp512) e 27,79 tokens/s na geração (tg128).

Teste de desempenho com llama.cpp CUDA, Llama 2 7B Q4_0 (3,56 GiB), sem Flash Attention
PlacaLargura de bandaGeração (tg128)Proporção do limite máximo
GTX 1060 6 GB192 GB/s27,79 tokens/s55 %
GTX 1070 Ti 8 GB256 GB/s37,82 tokens/s56 %
GTX 1660 6 GB192 GB/s41,35 tokens/s82 %
GTX 1080 Ti 11 GB484 GB/s62,49 tokens/s49 %

Duas conclusões se destacam. Primeiro, a 1060 atinge um pouco mais da metade do seu limite teórico. Depois, a GTX 1660, que possui a mesma largura de banda de 192 GB/s, alcança 41,35 tokens/s: a arquitetura Turing aproveita muito melhor a mesma memória. Com a mesma largura de banda, uma placa Pascal continua sendo, portanto, aproximadamente um terço mais lenta que uma Turing. Para um modelo Granite 4.2 8B em Q4 (4,6 GB), a estimativa por simples proporcionalidade (27,79 × 3,82 ÷ 4,6) dá cerca de 23 tokens/s: trata-se de um cálculo, não de uma medição, e a penalidade do contexto se soma a isso.

i
Por que o processamento do prompt também importa
O teste de benchmark registra 416,85 tokens/s na leitura do prompt na 1060. Um prompt de 2.000 tokens (um e-mail longo, uma página de documentação) leva, portanto, cerca de cinco segundos até a primeira palavra da resposta. É esse o atraso que você sentirá na prática assim que colar um documento.

#Com 6 GB, o fator decisivo é o contexto, não o modelo

Por padrão, Ollama usa uma janela de 4 096 tokens, que pode ser alterada com a variável OLLAMA_CONTEXT_LENGTH. Quanto maior a janela, mais memória o cache KV ocupa, e em 6 GB a margem é estreita. Um Granite 4.2 8B em Q4 deixa aproximadamente 1,4 GB para o cache e o sistema. Passar de 4 096 para 32 768 tokens multiplica o cache KV por oito: nesta placa, o limite é atingido muito antes da janela máxima anunciada pelo modelo.

O método para manter tudo na GPU: manter o contexto curto, escolher um modelo menor em vez de uma quantização mais agressiva e verificar com o comando ollama ps se a coluna PROCESSOR exibe 100% GPU. Uma divisão entre CPU e GPU indica que o modelo excede a capacidade da VRAM: a taxa de geração despenca, porque a memória do sistema é muito mais lenta que a GDDR5 da placa.

Verificar se o modelo cabe na GPU
ollama ps

A quantização do cache KV, que pode ser ativada com Flash Attention, reduz ainda mais o uso de memória: o guia dedicado detalha o ganho. O princípio continua o mesmo em qualquer placa: se o modelo e seu contexto não cabem juntos, reduza um dos dois.

#Drivers e CUDA: a data de validade do Pascal

A GTX 1060 ainda funciona, mas seu ambiente de software está se reduzindo. A documentação do Ollama especifica que as placas com compute capability de 5.0 a 6.2 exigem um driver NVIDIA 570 ou mais recente, e a GTX 1060 consta na lista de placas reconhecidas. Quanto à NVIDIA, as notas de versão do CUDA 13 indicam que o suporte a arquiteturas anteriores a Turing (Maxwell, Volta e Pascal) foi descontinuado: as novas ferramentas CUDA não têm mais sua placa como alvo.

Quanto aos drivers, a Wikipédia resume a situação: a NVIDIA encerrou em dezembro de 2025 o suporte Game Ready para Maxwell, Pascal e Volta, a série 580 é a última a oferecer suporte a essas arquiteturas, e estão previstas atualizações de segurança até outubro de 2028. Na prática, a placa não receberá mais otimizações nem suporte de compatibilidade com futuras versões de software.

O que isso muda para um uso de LLM
ComponenteSituação para a GTX 1060
OllamaCompatível com um driver 570 ou superior (lista oficial de compatibilidade)
CUDA Toolkit recenteSuporte a Pascal removido a partir do CUDA 13: optar por builds do CUDA 12
Driver NVIDIABranch 580, últimas atualizações de segurança até outubro de 2028
Novos mecanismos e novas otimizaçõesRisco crescente de incompatibilidade: verifique a cada atualização
!
Não atualize às cegas
Se sua instalação estiver funcionando, anote a versão do driver e a de Ollama antes de qualquer atualização e mantenha a versão anterior à mão. Uma ferramenta recente compilada para CUDA 13 pode deixar de reconhecer a placa.

#Instalar e verificar em quatro etapas

  1. 01
    Verificar o driver
    Execute nvidia-smi: a versão do driver deve ser 570 ou superior. Tanto no Windows quanto no Linux, instale a série 580 se estiver abaixo disso.
  2. 02
    Instalar Ollama
    Siga o guia de instalação do seu sistema e depois baixe um modelo pequeno (2 a 4 GB) antes de tentar um 8B.
  3. 03
    Verificar o posicionamento
    Inicie uma conversa e depois execute ollama ps em um segundo terminal: a coluna PROCESSOR deve indicar 100% GPU.
  4. 04
    Ajustar
    Se a taxa de geração for muito baixa ou se o processador participar do processamento, reduza o contexto ou mude para um modelo menor.

#Veredito: manter, comprar ou substituir

Se a placa já está no seu PC, vale dedicar uma noite a testá-la: ela funciona bem para conversas curtas, reformulação, tradução ou um pequeno assistente local com 3 a 4 bilhões de parâmetros. Se você pensa em comprá-la para IA, a resposta é não: com a mesma capacidade de memória, uma placa Turing ou mais recente oferece maior desempenho com a mesma largura de banda, melhor compatibilidade com software e suporte por muito mais tempo.

Decisão de acordo com a sua situação
Sua situaçãoRecomendação
Você já possui a placa e quer experimentarSim: modelos de 2 a 4 GB, contexto curto
Você quer rodar um 8B com folga e 8.000 tokens de contextoNão: trocar por uma placa de 8 GB ou mais
Você quer modelos de 12 a 14 bilhões de parâmetrosNão: buscar 12 GB ou mais
Você está pensando em comprar uma usadaNão: comparar placas Turing e Ampere de entrada

Para comparar sem consultar os preços aqui, que mudam toda semana, consulte a página de preços das placas de vídeo do site e o guia de modelos adequados para 6 GB de VRAM, para ver o que outras placas desse tamanho permitem.

FAQ
A GTX 1060 de 6 GB consegue rodar um modelo 8B?+
Sim, em Q4: um Granite 4.2 8B pesa aproximadamente 4,6 GB e deixa 1,4 GB para o contexto e o sistema. A taxa será inferior aos 27,79 tokens/s medidos em um modelo 7B Q4_0 pelo benchmark do llama.cpp, e o contexto deve permanecer curto. Um modelo com 3 a 4 bilhões de parâmetros é mais confortável.
GTX 1060 3 GB ou 6 GB para um LLM?+
Apenas a versão de 6 GB. A de 3 GB tem menos núcleos CUDA (1.152 contra 1.280) e apenas 3 GB de memória: um modelo de 3B em Q4 mal cabe nela com seu contexto. É adequada para um modelo pequeno de 1 a 2 bilhões de parâmetros, não para um assistente de chat sério.
Quantos tokens por segundo em uma GTX 1060?+
O benchmark público do llama.cpp mede 27,79 tokens/s na geração para um modelo 7B em Q4_0 e 416,85 tokens/s na leitura do prompt. Esses números dependem do driver, do sistema e da versão do llama.cpp: dão uma ordem de grandeza, não uma garantia.
Ollama ainda funciona em uma GTX 1060 em 2026?+
Sim: a GTX 1060 está na lista de placas compatíveis, com capacidade de computação 6.1. A documentação exige, no entanto, um driver NVIDIA 570 ou mais recente para placas com capacidade de computação de 5.0 a 6.2. Verifique sua versão com nvidia-smi antes de instalar.
Vale a pena comprar uma GTX 1060 usada para IA?+
Não, exceto para um teste com orçamento muito baixo. As arquiteturas Turing e mais recentes aproveitam melhor a mesma largura de banda, e o CUDA 13 não tem mais Pascal como alvo. Com um orçamento comparável, uma placa Turing ou Ampere de 8 GB oferece mais margem e suporte de software por mais tempo.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.