Iniciante 11 minGTX 16

Qual LLM usar em uma GTX 1650 / 1660 / Super / Ti ?

Resposta direta

Uma GTX 1660 (6 GB) consegue rodar um LLM local com 7 a 8 bilhões de parâmetros em Q4: o benchmark público do llama.cpp mede 41,35 tokens/s na geração com um modelo 7B Q4_0, mas apenas 148,91 tokens/s para ler o prompt. As versões GTX 1660 Super e Ti, com memória mais rápida, devem ser mais rápidas. A GTX 1650, limitada a 4 GB, fica restrita a modelos com 2 a 3 bilhões de parâmetros. Todas continuam sendo suportadas pelo CUDA 13.

A série GTX 16, lançada em 2019, é baseada na arquitetura Turing, sem Tensor Cores nem núcleos de rastreamento de raios. Diferentemente das GTX 10, ela não é afetada pelo fim do suporte ao Pascal. Este guia diferencia as quatro placas com base no que importa para um LLM — a memória e sua largura de banda —, apoia-se em medições públicas e alerta para uma armadilha: uma geração satisfatória não implica uma leitura rápida de prompts longos.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux
Hardware recomendado

Boa relação custo-benefício para IA local: um GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).

Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.

Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Orçamento apertado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#A série GTX 16 para um LLM: o que você precisa saber

Para um LLM, a série GTX 16 deve ser avaliada pela memória: 4 GB para a GTX 1650, 6 GB para as GTX 1660, 1660 Super e 1660 Ti. A velocidade de geração acompanha a largura de banda, que varia em uma proporção de até três para um: 128 GB/s para a 1650 com GDDR5, 192 GB/s para a 1660, 288 GB/s para a 1660 Ti e 336 GB/s para a 1660 Super. Com a mesma capacidade de 6 GB, a 1660 Super é, portanto, a mais rápida da série, e a 1660 original, a mais lenta.

Largura de banda e memória das GTX 16 (Wikipédia, GeForce 16 series)
PlacaMemóriaLargura de bandaNúcleos CUDA
GTX 1650 (GDDR5)4 GB, GDDR5, 128 bits128 GB/s896
GTX 1650 (GDDR6, abril de 2020)GDDR6192 GB/s896
GTX 16606 GB, GDDR5, 192 bits192 GB/s1 408
GTX 1660 Super6 GB, GDDR6336 GB/snão detalhado
GTX 1660 Ti6 GB, GDDR6288 GB/s1 536

A série não possui Tensor Cores nem RT Cores: a Wikipédia esclarece que ela é baseada na arquitetura Turing das RTX 20, sem esses dois tipos de unidades, e que mantém os núcleos dedicados a operações com números inteiros. Para modelos quantizados em inteiros, a ausência de Tensor Cores tem pouca influência na geração.

#Turing sem Tensor Cores: o que muda em relação ao Pascal

O ponto forte da série é o FP16. Em uma GTX 1660, a Wikipédia indica 8.617 GFLOPS em meia precisão contra 4.309 em precisão simples: o FP16 é duas vezes mais rápido que o FP32, embora seja muito mais lento que o FP32 em uma GTX 10 voltada ao consumidor, como mostra o guia da GTX 1080 Ti. Isso explica por que a 1660, com a mesma largura de banda de 192 GB/s, supera claramente uma GTX 1060 na geração, e por que o CUDA 13 não deixou de oferecer suporte a ela.

O contraexemplo está na leitura do prompt. O benchmark do llama.cpp dá 148,91 tokens/s na GTX 1660 durante o processamento do prompt, contra 416,85 na GTX 1060: uma placa mais recente pode ler um longo texto quase três vezes mais lentamente. O benchmark não detalha a causa; o resultado vem de um único contribuidor e deve ser lido como uma ordem de grandeza. No entanto, isso é suficiente para moderar o entusiasmo por documentos longos.

Teste com llama.cpp CUDA, Llama 2 7B Q4_0: uma 1660 frente às placas próximas a ela
PlacaLargura de bandaPrompt (pp512)Geração (tg128)
GTX 1060 6 GB (Pascal)192 GB/s416,85 tokens/s27,79 tokens/s
GTX 1660 6 GB (Turing)192 GB/s148,91 tokens/s41,35 tokens/s
Quadro T1000 4 GB128 GB/s79,44 tokens/s27,82 tokens/s
!
Uma única contribuição, um único cartão
Cada linha do benchmark vem de um colaborador, com seu driver e sistema. Comparar uma 1660 com uma 1060 nesse benchmark dá uma ordem de grandeza, não uma lei. Se a leitura do prompt for importante para você, teste sua placa com llama-bench.

#As quatro variantes, uma por uma

GTX 1650 (4 GB)
A bancada de testes não inclui uma 1650, mas inclui uma Quadro T1000 de 4 GB e 128 bits, com a mesma largura de banda: nela cabe um modelo de 7B em Q4_0 a 27,82 tokens/s com contexto mínimo. Esse é o limite: com 4 GB, é melhor usar um modelo de 2 a 3 bilhões de parâmetros.
GTX 1660 (6 GB GDDR5)
A placa da bancada de testes: 41,35 tokens/s na geração. A mais lenta entre as placas de 6 GB, mas suficiente para chat em Q4.
GTX 1660 Ti (6 GB GDDR6)
288 GB/s: 50 % a mais de largura de banda do que a 1660, portanto, espera-se um ganho de desempenho da mesma ordem, a ser confirmado por medição.
GTX 1660 Super (6 GB GDDR6)
336 GB/s: a melhor da série para um LLM, com 75% mais largura de banda que a 1660.

Essas extrapolações se baseiam apenas na largura de banda. Reaproveitando o rendimento da 1660 (82% do seu teto teórico), uma 1660 Ti produziria cerca de 62 tokens/s e uma 1660 Super, aproximadamente 72 no mesmo 7B Q4_0. São projeções que precisam ser confirmadas por uma medição na sua placa, nunca resultados.

Armadilha no momento da compra: existem duas versões da GTX 1650. A versão original de 2019 utiliza GDDR5 em um barramento de 128 bits, ou seja, 128 GB/s; uma revisão de abril de 2020 passa para GDDR6 a 12 Gbit/s e 192 GB/s. Para um LLM, isso representa um ganho potencial de 50% na taxa de transferência com o mesmo modelo. Verifique a indicação GDDR5 ou GDDR6 no anúncio, ou leia a ficha no GPU-Z, antes de comprar uma GTX 1650 usada.

#O contexto em 4 e 6 GB: o limite real

Ollama começa com uma janela de 4 096 tokens, que pode ser alterada por OLLAMA_CONTEXT_LENGTH. O cache KV cresce com cada token da conversa: dobrar a janela dobra o cache. Em 6 GB, com um Granite 4.2 8B em Q4, a margem de aproximadamente 1,4 GB é consumida rapidamente; em 4 GB, um modelo de 3B deixa 2 GB, uma margem mais confortável do que com um 8B em 6 GB.

Regra prática: em vez de uma quantização mais agressiva, reduza o tamanho do modelo ou o contexto. Um modelo de 3B com um contexto longo dá melhores resultados nessas placas do que um modelo de 8B que precisa transferir parte do processamento para o processador. Sempre verifique com ollama ps se o modelo permanece 100% na GPU: essa transferência faz a taxa de processamento cair, pois a memória RAM é muito mais lenta que a memória da placa.

Qual uso para qual placa?
UsoGTX 1650 (4 GB)GTX 1660 / Super / Ti (6 GB)
Chat curto, tradução, reformulaçãoModelo de 2 a 3B8B em Q4, contexto curto
Completação de código no editorModelo de 2 a 3B, qualidade limitadaÉ possível usar um modelo de 7 a 8 bilhões de parâmetros
Resumo de documentos longosNão recomendadoLento: leitura do prompt a 148,91 tokens/s na 1660
Pesquisa nos próprios documentos (RAG)Modelo de 3B, trechos curtosModelo de 3 a 8B, trechos curtos

#O que cabe: 4 GB contra 6 GB

Segundo os valores de referência do site, um modelo de 3B em Q4 ocupa cerca de 2 GB e um de 7-8B, cerca de 5 GB, sem contar o cache KV. Com 6 GB, sobram aproximadamente 1,4 GB ao usar um Granite 4.2 8B em Q4: suficiente para um contexto de alguns milhares de tokens, não mais. Com 4 GB, um modelo de 3B é o máximo razoável.

O que cabe em 4 GB e em 6 GB (pesos em Q4, catálogo QuelLLM)
Modelo (Q4)Tamanho do modeloEm 4 GBCom 6 GB
Gemma 4 2B1,2 GBConfortávelConfortável
Granite 4.1 3B2 GBConfortávelConfortável
Phi-4 Mini 3,8B3 GBApertadoConfortável
Granite 4.2 8B4,6 GBNão cabeMargem de 1,4 GB
Qwen3.5 9B6 GBNão cabeExcede a memória disponível com o contexto

Na 1650, limite-se aos modelos de 2 a 4 bilhões de parâmetros; essa também é a faixa adequada para rascunhos, tradução ou classificação. Nas 1660, o 8B em Q4 é o limite: continua utilizável para chat, mas deixa pouco espaço para um contexto longo.

#Suporte de software: uma vantagem clara sobre as GTX 10

O Ollama exige um driver NVIDIA 550 ou mais recente para placas recentes, contra 570 para placas com capacidade de computação de 5.0 a 6.2 (incluindo Pascal). A lista oficial do Ollama menciona a GTX 1650 Ti, assim como as RTX 20, com capacidade de computação 7.5. As demais GTX 16 compartilham a mesma arquitetura Turing sem serem mencionadas individualmente na lista: verificar no momento da instalação.

Quanto ao CUDA, as notas de versão do CUDA 13 indicam que o suporte descontinuado se refere às arquiteturas anteriores à Turing (Maxwell, Volta e Pascal): a arquitetura Turing e, portanto, as GTX 16 continuam recebendo suporte. Na compra de uma placa usada, esse é o principal argumento a favor de uma GTX 16 em vez de uma GTX 10 de preço semelhante.

Comparação do suporte de software
PontoGTX 16 (Turing)GTX 10 (Pascal)
Driver exigido pelo Ollama550 ou mais recente570 ou mais recente
CUDA 13CompatívelRemovido
Flash Attention no llama.cppDisponívelDisponível

#Instalar e ajustar

  1. 01
    Verificar o driver
    Execute nvidia-smi: a versão deve ser superior a 550.
  2. 02
    Instalar Ollama
    Siga o guia de instalação para o seu sistema e depois baixe um modelo adequado à memória disponível.
  3. 03
    Verificar o posicionamento
    Execute ollama ps: a coluna PROCESSOR deve mostrar 100% GPU. O processamento compartilhado com o processador indica que parte do modelo foi transferida para a RAM do sistema.
  4. 04
    Limitar o contexto
    Ollama começa com 4 096 tokens. Em 4 ou 6 GB, aumente esse valor somente se você tiver verificado que ainda há espaço.

Flash Attention não é exclusiva de placas com Tensor Cores: o llama.cpp a executa tanto na GTX 1660 quanto em uma placa Pascal, e o teste registra 154,45 tokens/s no processamento do prompt e 41,43 na geração com ela, contra 148,91 e 41,35 sem ela. O ganho é pequeno, mas o consumo de memória do contexto diminui, o que é útil com 6 GB. O Ollama a ativa automaticamente quando a placa oferece suporte.

#Veredito: qual GTX 16 escolher e quando mudar para outra opção

Decisão de acordo com a sua situação
Sua situaçãoRecomendação
Você tem uma 1660 Super ou 1660 TiO melhor da série: 8B em Q4, chat fluido
Você tem uma 1660Suficiente para o chat; leitura dos prompts lenta
Você tem uma 1650 (4 GB)Somente modelos de 2 a 4 bilhões de parâmetros
Você quer ler documentos longosUma placa Ampere ou mais recente lê o prompt muito mais rápido
Você quer um modelo de 12B ou maiorMudar de categoria: buscar uma placa com 12 GB ou mais

Um último ponto de referência para a leitura: essas placas não são feitas para cargas pesadas, mas seu orçamento térmico continua modesto (120 W para a GTX 1660, segundo a Wikipédia). Para um assistente local que responde a algumas perguntas por dia, isso é uma vantagem real em relação a uma placa de 250 W.

Com um orçamento comparável para comprar uma placa usada, a 1660 Super é uma opção melhor do que uma GTX 1060 ou 1070: mesma capacidade, memória mais rápida, suporte de software mais longo. Para comprar uma placa nova ou usá-la regularmente, uma RTX 3050 ou uma RTX 2060 acrescentam Tensor Cores e mais memória, dependendo da versão. Os preços mudam todas as semanas: consulte a página de preços do site.

FAQ
É possível executar um LLM em uma GTX 1660?+
Sim. O benchmark público do llama.cpp mede 41,35 tokens/s na geração para um modelo de 7B em Q4_0 em uma GTX 1660 de 6 GB, o que é suficiente para conversas. A leitura do prompt é mais lenta (148,91 tokens/s), então documentos longos demoram para serem processados. Um modelo de 8B em Q4 é o limite razoável.
Qual GTX 16 escolher para um LLM?+
A GTX 1660 Super: 6 GB e 336 GB/s de largura de banda, a melhor da série para geração. A 1660 Ti (288 GB/s) vem em seguida, depois a 1660 (192 GB/s). Escolha a 1650 apenas se você pretende usar modelos de 2 a 3 bilhões de parâmetros.
A GTX 1650 de 4 GB consegue executar um modelo 7B?+
No limite. A bancada de testes inclui uma Quadro T1000 de 4 GB que executa um modelo de 7B em Q4_0 a 27,82 tokens/s, com contexto mínimo. Na prática, uma 1650 se sai melhor com modelos de 2 a 3 bilhões de parâmetros, que deixam espaço para o contexto.
As GTX 16 são compatíveis com o Flash Attention?+
Sim. O benchmark do llama.cpp mede o desempenho do Flash Attention em uma GTX 1660: 154,45 tokens/s na leitura do prompt e 41,43 na geração com Flash Attention, contra 148,91 e 41,35 sem. O ganho é pequeno, mas o Flash Attention reduz a memória usada pelo contexto. A ausência de Tensor Cores, portanto, não impede seu funcionamento.
Uma GTX 1660 Super é melhor que uma GTX 1060 para IA?+
Sim. Com a mesma capacidade de 6 GB, a 1660 Super tem 336 GB/s contra 192 GB/s, e Turing aproveita melhor a memória: uma 1660 mede 41,35 tokens/s contra 27,79 de uma 1060. Turing também continua compatível com CUDA 13, ao contrário de Pascal.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.