Qual LLM para RTX 5060 Ti (8 / 16 GB) ?
Uma RTX 5060 Ti 16 GB mantém na VRAM modelos de até 14 bilhões de parâmetros (Qwen3 14B, 9,3 GB) e gpt-oss 20B (14 GB), a 41 tokens por segundo em um 14B segundo Hardware Corner. A versão de 8 GB limita-se a modelos com até 9 bilhões de parâmetros. A largura de banda de 448 GB/s é a mesma nas duas versões; a capacidade faz toda a diferença.
A RTX 5060 Ti existe em versões de 8 GB e 16 GB, com a mesma GPU e os mesmos 448 GB/s: apenas a capacidade determina o que você pode executar. Este guia apresenta, para cada versão, os modelos que realmente cabem, as taxas de geração medidas pela Hardware Corner, o efeito do contexto e a diferença em relação às placas próximas. Você também saberá quando optar por uma placa mais rápida.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Para este setup: RTX 5060 Ti 16 GB.
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#RTX 5060 Ti para um LLM local: o que permitem 16 GB a 448 GB/s
Para um LLM local, uma RTX 5060 Ti de 16 GB mantém inteiramente na VRAM modelos de até 14 a 20 bilhões de parâmetros, mas sua largura de banda de 448 GB/s a torna duas a três vezes mais lenta que as placas de ponta. De acordo com a biblioteca do Ollama, o Qwen3 14B pesa 9,3 GB e o gpt-oss 20B, 14 GB. A Hardware Corner mede 32,9 tokens por segundo no Qwen3 14B com 16.000 tokens de contexto e 43,8 no gpt-oss 20B com 128.000 tokens de contexto. Modelos de 27 a 32 bilhões de parâmetros, com 17 GB ou mais, não cabem. A versão de 8 GB, por sua vez, limita-se a modelos de 9 bilhões de parâmetros ou menos.
- Memória
- 16 GB ou 8 GB de GDDR7 em um barramento de 128 bits, conforme a NVIDIA; 448 GB/s de largura de banda, conforme a Hardware Corner.
- Consumo
- 180 W de potência gráfica e uma fonte de alimentação de 600 W necessária para o sistema, segundo a NVIDIA. Esse valor supera os 550 W frequentemente citados.
- Software
- Capacidade de cálculo 12.0, suportada pelo Ollama com um driver 550 ou mais recente.
#8 GB ou 16 GB: a única questão realmente importante
As duas versões compartilham a GPU e a largura de banda: apenas a capacidade muda, e é ela que determina o que você pode executar. A NVIDIA oferece a 5060 Ti em 16 GB e em 8 GB; a comparação abaixo utiliza os arquivos da biblioteca Ollama consultados em 29 de setembro de 2026.
| Modelo | Arquivo Ollama | Versão 8 GB | Versão de 16 GB |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | Cabe, com margem de 2,7 GB | Muito confortável |
| Qwen 3.5 9B | 6,6 GB | Cabe, com margem de 1,4 GB | Muito confortável |
| Gemma 4 12B | 7,6 GB | Margem de 0,4 GB: sem contexto | Confortável |
| Qwen3 14B | 9,3 GB | Não cabe | Margem de 6,7 GB |
| gpt-oss 20B | 14 GB | Não cabe | Cabe, com margem de 2 GB |
| Devstral Small 2 24B | 15 GB | Não cabe | Margem de apenas 1 GB |
| Qwen 3.5 27B | 17 GB | Não cabe | Não cabe |
Com 8 GB, um modelo de 9 bilhões deixa 1,4 GB para o contexto e o sistema: é pouca margem, e a transferência de parte do modelo para a RAM, mais lenta, logo se torna necessária. A versão de 16 GB dobra o catálogo e permite usar modelos de 12 a 20 bilhões. Para uso regular de LLM, a versão de 16 GB é a única que mantém uma margem, mesmo que ainda esteja longe de uma placa de 24 GB.
#Calcular sua margem antes de baixar um modelo
A regra é simples: a capacidade da placa menos o tamanho do arquivo dá a margem bruta, e essa margem precisa cobrir o cache KV, os buffers do mecanismo e o que o sistema operacional reserva para a tela. Com Qwen3 14B, 16 - 9,3 deixa 6,7 GB; com Qwen 3.5 9B na versão de 8 GB, 8 - 6,6 deixa 1,4 GB. Quanto menor a margem, mais você precisa reduzir o contexto e quantizar o cache. Se ollama ps mostrar uma divisão entre CPU e GPU, é porque o modelo ou o contexto não cabe na VRAM; nesse caso, a geração cai para a velocidade da RAM.
Na versão de 8 GB, três hábitos evitam a maioria dos estouros de memória de vídeo. Escolha um modelo com 9 bilhões de parâmetros ou menos, cujo arquivo fique abaixo de 7 GB. Mantenha o contexto modesto enquanto ollama ps mostrar 100 % GPU. E feche os aplicativos que consomem memória de vídeo, como o navegador ou os jogos, antes de iniciar o modelo.
#Modelos recomendados para 16 GB
O bom reflexo é começar pelo Qwen3 14B ou pelo gpt-oss 20B. O Qwen3 14B deixa cerca de 7 GB para o contexto. O gpt-oss 20B cabe em 14 GB porque, segundo o Ollama, seus pesos de especialistas são quantizados em MXFP4 com 4,25 bits por parâmetro, o que permite que ele rode em 16 GB de memória. Um modelo de 24 bilhões em Q4, como o Devstral Small 2 (15 GB), deixa apenas um GB: ele aguenta uma troca curta, mas não um agente. Um RAG local adiciona um modelo de embeddings: o bge-m3 pesa 1,2 GB no Ollama, totalizando 7,8 GB com o Qwen 3.5 9B.
#Instalar Ollama em uma RTX 5060 Ti
- 01Verificar o driverExecute nvidia-smi no terminal: o driver deve estar na versão 550 ou mais (551.61 no Windows) e a memória total deve exibir 16 GB, ou 8 GB para a outra versão.
- 02Instalar OllamaInstale o Ollama pelo site oficial. A API local fica disponível em http://localhost:11434.
- 03Executar um modeloExecute ollama run qwen3:14b em 16 GB ou ollama run qwen3.5:9b em 8 GB. O download é feito apenas uma vez.
- 04Verificar a distribuiçãoEm um segundo terminal, execute ollama ps: a coluna Processador deve exibir 100% GPU. Na versão de 8 GB, uma divisão CPU/GPU significa que o modelo ou o contexto excede a capacidade da VRAM: escolha um modelo mais leve.
- 05Ajustar o contextoDefina o contexto com OLLAMA_CONTEXT_LENGTH, depois execute ollama ps novamente. Se não houver margem suficiente, defina OLLAMA_FLASH_ATTENTION como 1 e OLLAMA_KV_CACHE_TYPE como q8_0 na inicialização.
#Taxas medidas: a largura de banda define o ritmo
Os números vêm do Hardware Corner, que testa a versão de 16 GB usando llama.cpp com contextos de 4k a 128k. Essas medições não são do QuelLLM.
| Modelo (Q4_K, ou MXFP4 para gpt-oss) | Contexto 4k | Contexto 32k | Contexto 128k | Leitura de prompt 4k |
|---|---|---|---|---|
| Qwen3 8B | 69,2 | 38,9 | não medido | 2 965,1 |
| Qwen3 14B | 41,1 | 25,9 | não medido | 1 743,0 |
| gpt-oss 20B (MXFP4) | 92,1 | 73,2 | 43,8 | 3 585,2 |
A geração é limitada pela largura de banda: o limite teórico equivale aproximadamente à largura de banda dividida pelo peso do modelo. Para Qwen3 14B (9,3 GB), 448 ÷ 9,3 dá 48 tokens por segundo, e o valor medido com contexto de 4k, 41,1, atinge 85% desse limite. O contexto reduz a velocidade: Qwen3 14B perde 37% entre 4k e 32k (de 41,1 para 25,9). gpt-oss 20B, um modelo com especialistas, ultrapassa seu limite aparente (448 ÷ 14 = 32) com 92,1 tokens por segundo, pois só lê uma parte de seus pesos por token.
Ollama define o contexto padrão com base na memória de vídeo: sua documentação indica 4k tokens para menos de 24 GiB de VRAM e recomenda pelo menos 64.000 tokens para agentes e pesquisa na web. A 5060 Ti se enquadra na faixa de 4k. De acordo com sua FAQ, q8_0 reduz a memória ocupada pelo cache KV para cerca da metade da usada em f16, com perda de precisão muito baixa: é o primeiro ajuste a ativar com 16 GB e é indispensável com 8 GB.
#5060 Ti em comparação com outras placas: a diferença medida
| Placa | Memória | Geração relativa |
|---|---|---|
| RTX 5070 Ti | 16 GB | 176 % |
| RTX 3090 | 24 GB | 158 % |
| RTX 4070 Super | 12 GB | 113 % |
| RTX 5060 Ti | 16 GB | 100 % |
| RTX 3060 | 12 GB | 69 % |
| RTX 4060 Ti | 16 GB | 68 % |
Este gráfico mostra o compromisso da 5060 Ti: ela gera quase metade mais rápido do que a 4060 Ti 16 GB (100 ÷ 68), graças à sua memória GDDR7 (448 contra 288 GB/s), mas ela continua longe da 5070 Ti, que oferece a mesma capacidade com 76% de velocidade a mais. Para o desempenho só no fluxo, uma 4070 Super de 12 GB é mais rápida, mas não cabe gpt-oss 20B. Segundo o Hardware Corner, seu custo/benefício em memória torna-a a 'rainha do valor' para iniciantes em 2026; compare com o acompanhamento dos preços atuais.
O Hardware Corner também destaca que duas placas de 16 GB permitem chegar a 32 GB sem pagar o preço de uma placa topo de linha. A distribuição entre duas GPUs é feita pelo llama.cpp e pelo seu modo tensor-split, detalhado no guia multi-GPU; ela aumenta a capacidade, não a velocidade por placa.
#Veredito: 16 GB, 8 GB ou outra placa
| Situação | Decisão | Justificativa em números |
|---|---|---|
| Uso regular de LLM, orçamento controlado | 5060 Ti 16 GB | gpt-oss 20B com 128k de contexto: 43,8 t/s |
| Você quer principalmente um modelo de 8 a 9 bilhões | A versão de 8 GB pode ser suficiente | Margem de 1,4 GB com Qwen 3.5 9B |
| Você quer velocidade mantendo a mesma capacidade | 5070 Ti | 176 % da velocidade da 5060 Ti |
| Você quer um 27B denso | Placa de 24 GB | Qwen 3.5 27B pesa 17 GB |
| Você já tem uma 4060 Ti 16 GB | Mantê-la, a menos que seja necessário mais desempenho | 68 % da velocidade da 5060 Ti |
Um método de decisão consiste em duas perguntas. Qual o maior modelo que você deseja lançar? Com menos de 9 bilhões de parâmetros, 8 GB é suficiente; entre 12 e 20 bilhões, é necessário 16 GB; acima disso, é necessária uma placa de 24 GB ou duas placas. Qual velocidade você aceita? Com 40 tokens por segundo em um modelo de 14B, a leitura continua fluida; a 5070 Ti só se justifica se você gerar textos longos ou atender várias pessoas.
Para o ajuste fino, o Unsloth indica mínimos de VRAM em QLoRA de 4 bits: 6 GB para um modelo de 8 bilhões, 8,5 GB para 14 bilhões e 22 GB para 27 bilhões. A versão de 16 GB permite, portanto, fazer o ajuste fino de um modelo de 14B com um lote de tamanho 1 e contexto curto. Para os preços atuais, consulte nosso acompanhamento, que registra o preço mais baixo de cada placa duas vezes por semana.
- Fonte: NVIDIA, especificações da família RTX 5060
- Fonte: Hardware Corner, benchmarks de LLM na RTX 5060 Ti 16 GB
- Fonte: Ollama, página do modelo gpt-oss
- Fonte: documentação do Ollama, comprimento de contexto
- Fonte: Unsloth, VRAM necessária para fine-tuning
#Perguntas frequentes
RTX 5060 Ti de 8 GB ou 16 GB para um LLM local?+
Quantos tokens por segundo em uma RTX 5060 Ti?+
A RTX 5060 Ti 16 GB consegue rodar um modelo de 24 ou 32 bilhões?+
Qual fonte de alimentação para uma RTX 5060 Ti?+
RTX 5060 Ti ou RTX 4060 Ti 16 GB para os LLM?+
É possível fazer fine-tuning de um modelo em uma RTX 5060 Ti de 16 GB?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.