Qual LLM usar em uma GTX 1650 / 1660 / Super / Ti ?
Uma GTX 1660 (6 GB) consegue rodar um LLM local com 7 a 8 bilhões de parâmetros em Q4: o benchmark público do llama.cpp mede 41,35 tokens/s na geração com um modelo 7B Q4_0, mas apenas 148,91 tokens/s para ler o prompt. As versões GTX 1660 Super e Ti, com memória mais rápida, devem ser mais rápidas. A GTX 1650, limitada a 4 GB, fica restrita a modelos com 2 a 3 bilhões de parâmetros. Todas continuam sendo suportadas pelo CUDA 13.
A série GTX 16, lançada em 2019, é baseada na arquitetura Turing, sem Tensor Cores nem núcleos de rastreamento de raios. Diferentemente das GTX 10, ela não é afetada pelo fim do suporte ao Pascal. Este guia diferencia as quatro placas com base no que importa para um LLM — a memória e sua largura de banda —, apoia-se em medições públicas e alerta para uma armadilha: uma geração satisfatória não implica uma leitura rápida de prompts longos.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Boa relação custo-benefício para IA local: um GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.
Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Orçamento apertado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#A série GTX 16 para um LLM: o que você precisa saber
Para um LLM, a série GTX 16 deve ser avaliada pela memória: 4 GB para a GTX 1650, 6 GB para as GTX 1660, 1660 Super e 1660 Ti. A velocidade de geração acompanha a largura de banda, que varia em uma proporção de até três para um: 128 GB/s para a 1650 com GDDR5, 192 GB/s para a 1660, 288 GB/s para a 1660 Ti e 336 GB/s para a 1660 Super. Com a mesma capacidade de 6 GB, a 1660 Super é, portanto, a mais rápida da série, e a 1660 original, a mais lenta.
| Placa | Memória | Largura de banda | Núcleos CUDA |
|---|---|---|---|
| GTX 1650 (GDDR5) | 4 GB, GDDR5, 128 bits | 128 GB/s | 896 |
| GTX 1650 (GDDR6, abril de 2020) | GDDR6 | 192 GB/s | 896 |
| GTX 1660 | 6 GB, GDDR5, 192 bits | 192 GB/s | 1 408 |
| GTX 1660 Super | 6 GB, GDDR6 | 336 GB/s | não detalhado |
| GTX 1660 Ti | 6 GB, GDDR6 | 288 GB/s | 1 536 |
A série não possui Tensor Cores nem RT Cores: a Wikipédia esclarece que ela é baseada na arquitetura Turing das RTX 20, sem esses dois tipos de unidades, e que mantém os núcleos dedicados a operações com números inteiros. Para modelos quantizados em inteiros, a ausência de Tensor Cores tem pouca influência na geração.
#Turing sem Tensor Cores: o que muda em relação ao Pascal
O ponto forte da série é o FP16. Em uma GTX 1660, a Wikipédia indica 8.617 GFLOPS em meia precisão contra 4.309 em precisão simples: o FP16 é duas vezes mais rápido que o FP32, embora seja muito mais lento que o FP32 em uma GTX 10 voltada ao consumidor, como mostra o guia da GTX 1080 Ti. Isso explica por que a 1660, com a mesma largura de banda de 192 GB/s, supera claramente uma GTX 1060 na geração, e por que o CUDA 13 não deixou de oferecer suporte a ela.
O contraexemplo está na leitura do prompt. O benchmark do llama.cpp dá 148,91 tokens/s na GTX 1660 durante o processamento do prompt, contra 416,85 na GTX 1060: uma placa mais recente pode ler um longo texto quase três vezes mais lentamente. O benchmark não detalha a causa; o resultado vem de um único contribuidor e deve ser lido como uma ordem de grandeza. No entanto, isso é suficiente para moderar o entusiasmo por documentos longos.
| Placa | Largura de banda | Prompt (pp512) | Geração (tg128) |
|---|---|---|---|
| GTX 1060 6 GB (Pascal) | 192 GB/s | 416,85 tokens/s | 27,79 tokens/s |
| GTX 1660 6 GB (Turing) | 192 GB/s | 148,91 tokens/s | 41,35 tokens/s |
| Quadro T1000 4 GB | 128 GB/s | 79,44 tokens/s | 27,82 tokens/s |
#As quatro variantes, uma por uma
- GTX 1650 (4 GB)
- A bancada de testes não inclui uma 1650, mas inclui uma Quadro T1000 de 4 GB e 128 bits, com a mesma largura de banda: nela cabe um modelo de 7B em Q4_0 a 27,82 tokens/s com contexto mínimo. Esse é o limite: com 4 GB, é melhor usar um modelo de 2 a 3 bilhões de parâmetros.
- GTX 1660 (6 GB GDDR5)
- A placa da bancada de testes: 41,35 tokens/s na geração. A mais lenta entre as placas de 6 GB, mas suficiente para chat em Q4.
- GTX 1660 Ti (6 GB GDDR6)
- 288 GB/s: 50 % a mais de largura de banda do que a 1660, portanto, espera-se um ganho de desempenho da mesma ordem, a ser confirmado por medição.
- GTX 1660 Super (6 GB GDDR6)
- 336 GB/s: a melhor da série para um LLM, com 75% mais largura de banda que a 1660.
Essas extrapolações se baseiam apenas na largura de banda. Reaproveitando o rendimento da 1660 (82% do seu teto teórico), uma 1660 Ti produziria cerca de 62 tokens/s e uma 1660 Super, aproximadamente 72 no mesmo 7B Q4_0. São projeções que precisam ser confirmadas por uma medição na sua placa, nunca resultados.
Armadilha no momento da compra: existem duas versões da GTX 1650. A versão original de 2019 utiliza GDDR5 em um barramento de 128 bits, ou seja, 128 GB/s; uma revisão de abril de 2020 passa para GDDR6 a 12 Gbit/s e 192 GB/s. Para um LLM, isso representa um ganho potencial de 50% na taxa de transferência com o mesmo modelo. Verifique a indicação GDDR5 ou GDDR6 no anúncio, ou leia a ficha no GPU-Z, antes de comprar uma GTX 1650 usada.
#O contexto em 4 e 6 GB: o limite real
Ollama começa com uma janela de 4 096 tokens, que pode ser alterada por OLLAMA_CONTEXT_LENGTH. O cache KV cresce com cada token da conversa: dobrar a janela dobra o cache. Em 6 GB, com um Granite 4.2 8B em Q4, a margem de aproximadamente 1,4 GB é consumida rapidamente; em 4 GB, um modelo de 3B deixa 2 GB, uma margem mais confortável do que com um 8B em 6 GB.
Regra prática: em vez de uma quantização mais agressiva, reduza o tamanho do modelo ou o contexto. Um modelo de 3B com um contexto longo dá melhores resultados nessas placas do que um modelo de 8B que precisa transferir parte do processamento para o processador. Sempre verifique com ollama ps se o modelo permanece 100% na GPU: essa transferência faz a taxa de processamento cair, pois a memória RAM é muito mais lenta que a memória da placa.
| Uso | GTX 1650 (4 GB) | GTX 1660 / Super / Ti (6 GB) |
|---|---|---|
| Chat curto, tradução, reformulação | Modelo de 2 a 3B | 8B em Q4, contexto curto |
| Completação de código no editor | Modelo de 2 a 3B, qualidade limitada | É possível usar um modelo de 7 a 8 bilhões de parâmetros |
| Resumo de documentos longos | Não recomendado | Lento: leitura do prompt a 148,91 tokens/s na 1660 |
| Pesquisa nos próprios documentos (RAG) | Modelo de 3B, trechos curtos | Modelo de 3 a 8B, trechos curtos |
#O que cabe: 4 GB contra 6 GB
Segundo os valores de referência do site, um modelo de 3B em Q4 ocupa cerca de 2 GB e um de 7-8B, cerca de 5 GB, sem contar o cache KV. Com 6 GB, sobram aproximadamente 1,4 GB ao usar um Granite 4.2 8B em Q4: suficiente para um contexto de alguns milhares de tokens, não mais. Com 4 GB, um modelo de 3B é o máximo razoável.
| Modelo (Q4) | Tamanho do modelo | Em 4 GB | Com 6 GB |
|---|---|---|---|
| Gemma 4 2B | 1,2 GB | Confortável | Confortável |
| Granite 4.1 3B | 2 GB | Confortável | Confortável |
| Phi-4 Mini 3,8B | 3 GB | Apertado | Confortável |
| Granite 4.2 8B | 4,6 GB | Não cabe | Margem de 1,4 GB |
| Qwen3.5 9B | 6 GB | Não cabe | Excede a memória disponível com o contexto |
Na 1650, limite-se aos modelos de 2 a 4 bilhões de parâmetros; essa também é a faixa adequada para rascunhos, tradução ou classificação. Nas 1660, o 8B em Q4 é o limite: continua utilizável para chat, mas deixa pouco espaço para um contexto longo.
#Suporte de software: uma vantagem clara sobre as GTX 10
O Ollama exige um driver NVIDIA 550 ou mais recente para placas recentes, contra 570 para placas com capacidade de computação de 5.0 a 6.2 (incluindo Pascal). A lista oficial do Ollama menciona a GTX 1650 Ti, assim como as RTX 20, com capacidade de computação 7.5. As demais GTX 16 compartilham a mesma arquitetura Turing sem serem mencionadas individualmente na lista: verificar no momento da instalação.
Quanto ao CUDA, as notas de versão do CUDA 13 indicam que o suporte descontinuado se refere às arquiteturas anteriores à Turing (Maxwell, Volta e Pascal): a arquitetura Turing e, portanto, as GTX 16 continuam recebendo suporte. Na compra de uma placa usada, esse é o principal argumento a favor de uma GTX 16 em vez de uma GTX 10 de preço semelhante.
| Ponto | GTX 16 (Turing) | GTX 10 (Pascal) |
|---|---|---|
| Driver exigido pelo Ollama | 550 ou mais recente | 570 ou mais recente |
| CUDA 13 | Compatível | Removido |
| Flash Attention no llama.cpp | Disponível | Disponível |
#Instalar e ajustar
- 01Verificar o driverExecute nvidia-smi: a versão deve ser superior a 550.
- 02Instalar OllamaSiga o guia de instalação para o seu sistema e depois baixe um modelo adequado à memória disponível.
- 03Verificar o posicionamentoExecute ollama ps: a coluna PROCESSOR deve mostrar 100% GPU. O processamento compartilhado com o processador indica que parte do modelo foi transferida para a RAM do sistema.
- 04Limitar o contextoOllama começa com 4 096 tokens. Em 4 ou 6 GB, aumente esse valor somente se você tiver verificado que ainda há espaço.
Flash Attention não é exclusiva de placas com Tensor Cores: o llama.cpp a executa tanto na GTX 1660 quanto em uma placa Pascal, e o teste registra 154,45 tokens/s no processamento do prompt e 41,43 na geração com ela, contra 148,91 e 41,35 sem ela. O ganho é pequeno, mas o consumo de memória do contexto diminui, o que é útil com 6 GB. O Ollama a ativa automaticamente quando a placa oferece suporte.
- Instalar Ollama passo a passo
- Resolver problemas do Ollama: GPU não detectada, lentidão
- Quantizar o KV cache para economizar VRAM
#Veredito: qual GTX 16 escolher e quando mudar para outra opção
| Sua situação | Recomendação |
|---|---|
| Você tem uma 1660 Super ou 1660 Ti | O melhor da série: 8B em Q4, chat fluido |
| Você tem uma 1660 | Suficiente para o chat; leitura dos prompts lenta |
| Você tem uma 1650 (4 GB) | Somente modelos de 2 a 4 bilhões de parâmetros |
| Você quer ler documentos longos | Uma placa Ampere ou mais recente lê o prompt muito mais rápido |
| Você quer um modelo de 12B ou maior | Mudar de categoria: buscar uma placa com 12 GB ou mais |
Um último ponto de referência para a leitura: essas placas não são feitas para cargas pesadas, mas seu orçamento térmico continua modesto (120 W para a GTX 1660, segundo a Wikipédia). Para um assistente local que responde a algumas perguntas por dia, isso é uma vantagem real em relação a uma placa de 250 W.
Com um orçamento comparável para comprar uma placa usada, a 1660 Super é uma opção melhor do que uma GTX 1060 ou 1070: mesma capacidade, memória mais rápida, suporte de software mais longo. Para comprar uma placa nova ou usá-la regularmente, uma RTX 3050 ou uma RTX 2060 acrescentam Tensor Cores e mais memória, dependendo da versão. Os preços mudam todas as semanas: consulte a página de preços do site.
- Qual LLM no RTX 3050
- Qual LLM para a RTX 2060 / 2060 Super
- Quais modelos para 6 GB de VRAM, considerando todas as placas
- Comparar os preços de GPU para IA
- Fonte: benchmark público llama.cpp em CUDA
- Fonte: documentação do Ollama, hardware NVIDIA suportado
- Fonte: GeForce série 16, especificações
- Fonte: notas de versão do CUDA Toolkit
É possível executar um LLM em uma GTX 1660?+
Qual GTX 16 escolher para um LLM?+
A GTX 1650 de 4 GB consegue executar um modelo 7B?+
As GTX 16 são compatíveis com o Flash Attention?+
Uma GTX 1660 Super é melhor que uma GTX 1060 para IA?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.