Iniciante 11 minRTX 50

Qual LLM para RTX 5060 Ti (8 / 16 GB) ?

Resposta direta

Uma RTX 5060 Ti 16 GB mantém na VRAM modelos de até 14 bilhões de parâmetros (Qwen3 14B, 9,3 GB) e gpt-oss 20B (14 GB), a 41 tokens por segundo em um 14B segundo Hardware Corner. A versão de 8 GB limita-se a modelos com até 9 bilhões de parâmetros. A largura de banda de 448 GB/s é a mesma nas duas versões; a capacidade faz toda a diferença.

A RTX 5060 Ti existe em versões de 8 GB e 16 GB, com a mesma GPU e os mesmos 448 GB/s: apenas a capacidade determina o que você pode executar. Este guia apresenta, para cada versão, os modelos que realmente cabem, as taxas de geração medidas pela Hardware Corner, o efeito do contexto e a diferença em relação às placas próximas. Você também saberá quando optar por uma placa mais rápida.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-29·Testado no Windows, macOS e Linux
Hardware recomendado

Para este setup: RTX 5060 Ti 16 GB.

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#RTX 5060 Ti para um LLM local: o que permitem 16 GB a 448 GB/s

Para um LLM local, uma RTX 5060 Ti de 16 GB mantém inteiramente na VRAM modelos de até 14 a 20 bilhões de parâmetros, mas sua largura de banda de 448 GB/s a torna duas a três vezes mais lenta que as placas de ponta. De acordo com a biblioteca do Ollama, o Qwen3 14B pesa 9,3 GB e o gpt-oss 20B, 14 GB. A Hardware Corner mede 32,9 tokens por segundo no Qwen3 14B com 16.000 tokens de contexto e 43,8 no gpt-oss 20B com 128.000 tokens de contexto. Modelos de 27 a 32 bilhões de parâmetros, com 17 GB ou mais, não cabem. A versão de 8 GB, por sua vez, limita-se a modelos de 9 bilhões de parâmetros ou menos.

Memória
16 GB ou 8 GB de GDDR7 em um barramento de 128 bits, conforme a NVIDIA; 448 GB/s de largura de banda, conforme a Hardware Corner.
Consumo
180 W de potência gráfica e uma fonte de alimentação de 600 W necessária para o sistema, segundo a NVIDIA. Esse valor supera os 550 W frequentemente citados.
Software
Capacidade de cálculo 12.0, suportada pelo Ollama com um driver 550 ou mais recente.

#8 GB ou 16 GB: a única questão realmente importante

As duas versões compartilham a GPU e a largura de banda: apenas a capacidade muda, e é ela que determina o que você pode executar. A NVIDIA oferece a 5060 Ti em 16 GB e em 8 GB; a comparação abaixo utiliza os arquivos da biblioteca Ollama consultados em 29 de setembro de 2026.

O que cabe conforme a versão (arquivos Ollama, Q4 salvo indicação)
ModeloArquivo OllamaVersão 8 GBVersão de 16 GB
Granite 4.2 8B5,3 GBCabe, com margem de 2,7 GBMuito confortável
Qwen 3.5 9B6,6 GBCabe, com margem de 1,4 GBMuito confortável
Gemma 4 12B7,6 GBMargem de 0,4 GB: sem contextoConfortável
Qwen3 14B9,3 GBNão cabeMargem de 6,7 GB
gpt-oss 20B14 GBNão cabeCabe, com margem de 2 GB
Devstral Small 2 24B15 GBNão cabeMargem de apenas 1 GB
Qwen 3.5 27B17 GBNão cabeNão cabe

Com 8 GB, um modelo de 9 bilhões deixa 1,4 GB para o contexto e o sistema: é pouca margem, e a transferência de parte do modelo para a RAM, mais lenta, logo se torna necessária. A versão de 16 GB dobra o catálogo e permite usar modelos de 12 a 20 bilhões. Para uso regular de LLM, a versão de 16 GB é a única que mantém uma margem, mesmo que ainda esteja longe de uma placa de 24 GB.

#Calcular sua margem antes de baixar um modelo

A regra é simples: a capacidade da placa menos o tamanho do arquivo dá a margem bruta, e essa margem precisa cobrir o cache KV, os buffers do mecanismo e o que o sistema operacional reserva para a tela. Com Qwen3 14B, 16 - 9,3 deixa 6,7 GB; com Qwen 3.5 9B na versão de 8 GB, 8 - 6,6 deixa 1,4 GB. Quanto menor a margem, mais você precisa reduzir o contexto e quantizar o cache. Se ollama ps mostrar uma divisão entre CPU e GPU, é porque o modelo ou o contexto não cabe na VRAM; nesse caso, a geração cai para a velocidade da RAM.

Na versão de 8 GB, três hábitos evitam a maioria dos estouros de memória de vídeo. Escolha um modelo com 9 bilhões de parâmetros ou menos, cujo arquivo fique abaixo de 7 GB. Mantenha o contexto modesto enquanto ollama ps mostrar 100 % GPU. E feche os aplicativos que consomem memória de vídeo, como o navegador ou os jogos, antes de iniciar o modelo.

#Modelos recomendados para 16 GB

O bom reflexo é começar pelo Qwen3 14B ou pelo gpt-oss 20B. O Qwen3 14B deixa cerca de 7 GB para o contexto. O gpt-oss 20B cabe em 14 GB porque, segundo o Ollama, seus pesos de especialistas são quantizados em MXFP4 com 4,25 bits por parâmetro, o que permite que ele rode em 16 GB de memória. Um modelo de 24 bilhões em Q4, como o Devstral Small 2 (15 GB), deixa apenas um GB: ele aguenta uma troca curta, mas não um agente. Um RAG local adiciona um modelo de embeddings: o bge-m3 pesa 1,2 GB no Ollama, totalizando 7,8 GB com o Qwen 3.5 9B.

#Instalar Ollama em uma RTX 5060 Ti

  1. 01
    Verificar o driver
    Execute nvidia-smi no terminal: o driver deve estar na versão 550 ou mais (551.61 no Windows) e a memória total deve exibir 16 GB, ou 8 GB para a outra versão.
  2. 02
    Instalar Ollama
    Instale o Ollama pelo site oficial. A API local fica disponível em http://localhost:11434.
  3. 03
    Executar um modelo
    Execute ollama run qwen3:14b em 16 GB ou ollama run qwen3.5:9b em 8 GB. O download é feito apenas uma vez.
  4. 04
    Verificar a distribuição
    Em um segundo terminal, execute ollama ps: a coluna Processador deve exibir 100% GPU. Na versão de 8 GB, uma divisão CPU/GPU significa que o modelo ou o contexto excede a capacidade da VRAM: escolha um modelo mais leve.
  5. 05
    Ajustar o contexto
    Defina o contexto com OLLAMA_CONTEXT_LENGTH, depois execute ollama ps novamente. Se não houver margem suficiente, defina OLLAMA_FLASH_ATTENTION como 1 e OLLAMA_KV_CACHE_TYPE como q8_0 na inicialização.
Comandos básicos
ollama run qwen3:14b
ollama run gpt-oss:20b
ollama ps

# Exemple de la documentation Ollama : contexte de 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#Taxas medidas: a largura de banda define o ritmo

Os números vêm do Hardware Corner, que testa a versão de 16 GB usando llama.cpp com contextos de 4k a 128k. Essas medições não são do QuelLLM.

Geração na RTX 5060 Ti 16 GB, tokens por segundo (Hardware Corner)
Modelo (Q4_K, ou MXFP4 para gpt-oss)Contexto 4kContexto 32kContexto 128kLeitura de prompt 4k
Qwen3 8B69,238,9não medido2 965,1
Qwen3 14B41,125,9não medido1 743,0
gpt-oss 20B (MXFP4)92,173,243,83 585,2

A geração é limitada pela largura de banda: o limite teórico equivale aproximadamente à largura de banda dividida pelo peso do modelo. Para Qwen3 14B (9,3 GB), 448 ÷ 9,3 dá 48 tokens por segundo, e o valor medido com contexto de 4k, 41,1, atinge 85% desse limite. O contexto reduz a velocidade: Qwen3 14B perde 37% entre 4k e 32k (de 41,1 para 25,9). gpt-oss 20B, um modelo com especialistas, ultrapassa seu limite aparente (448 ÷ 14 = 32) com 92,1 tokens por segundo, pois só lê uma parte de seus pesos por token.

Ollama define o contexto padrão com base na memória de vídeo: sua documentação indica 4k tokens para menos de 24 GiB de VRAM e recomenda pelo menos 64.000 tokens para agentes e pesquisa na web. A 5060 Ti se enquadra na faixa de 4k. De acordo com sua FAQ, q8_0 reduz a memória ocupada pelo cache KV para cerca da metade da usada em f16, com perda de precisão muito baixa: é o primeiro ajuste a ativar com 16 GB e é indispensável com 8 GB.

#5060 Ti em comparação com outras placas: a diferença medida

Geração relativa por placa (Hardware Corner, 5060 Ti 16 GB = 100 %)
PlacaMemóriaGeração relativa
RTX 5070 Ti16 GB176 %
RTX 309024 GB158 %
RTX 4070 Super12 GB113 %
RTX 5060 Ti16 GB100 %
RTX 306012 GB69 %
RTX 4060 Ti16 GB68 %

Este gráfico mostra o compromisso da 5060 Ti: ela gera quase metade mais rápido do que a 4060 Ti 16 GB (100 ÷ 68), graças à sua memória GDDR7 (448 contra 288 GB/s), mas ela continua longe da 5070 Ti, que oferece a mesma capacidade com 76% de velocidade a mais. Para o desempenho só no fluxo, uma 4070 Super de 12 GB é mais rápida, mas não cabe gpt-oss 20B. Segundo o Hardware Corner, seu custo/benefício em memória torna-a a 'rainha do valor' para iniciantes em 2026; compare com o acompanhamento dos preços atuais.

O Hardware Corner também destaca que duas placas de 16 GB permitem chegar a 32 GB sem pagar o preço de uma placa topo de linha. A distribuição entre duas GPUs é feita pelo llama.cpp e pelo seu modo tensor-split, detalhado no guia multi-GPU; ela aumenta a capacidade, não a velocidade por placa.

#Veredito: 16 GB, 8 GB ou outra placa

Qual decisão tomar de acordo com sua situação
SituaçãoDecisãoJustificativa em números
Uso regular de LLM, orçamento controlado5060 Ti 16 GBgpt-oss 20B com 128k de contexto: 43,8 t/s
Você quer principalmente um modelo de 8 a 9 bilhõesA versão de 8 GB pode ser suficienteMargem de 1,4 GB com Qwen 3.5 9B
Você quer velocidade mantendo a mesma capacidade5070 Ti176 % da velocidade da 5060 Ti
Você quer um 27B densoPlaca de 24 GBQwen 3.5 27B pesa 17 GB
Você já tem uma 4060 Ti 16 GBMantê-la, a menos que seja necessário mais desempenho68 % da velocidade da 5060 Ti

Um método de decisão consiste em duas perguntas. Qual o maior modelo que você deseja lançar? Com menos de 9 bilhões de parâmetros, 8 GB é suficiente; entre 12 e 20 bilhões, é necessário 16 GB; acima disso, é necessária uma placa de 24 GB ou duas placas. Qual velocidade você aceita? Com 40 tokens por segundo em um modelo de 14B, a leitura continua fluida; a 5070 Ti só se justifica se você gerar textos longos ou atender várias pessoas.

Para o ajuste fino, o Unsloth indica mínimos de VRAM em QLoRA de 4 bits: 6 GB para um modelo de 8 bilhões, 8,5 GB para 14 bilhões e 22 GB para 27 bilhões. A versão de 16 GB permite, portanto, fazer o ajuste fino de um modelo de 14B com um lote de tamanho 1 e contexto curto. Para os preços atuais, consulte nosso acompanhamento, que registra o preço mais baixo de cada placa duas vezes por semana.

#Perguntas frequentes

FAQ
RTX 5060 Ti de 8 GB ou 16 GB para um LLM local?+
Pegue a versão de 16 GB se quiser rodar algo além de um modelo de 9 bilhões de parâmetros. A GPU e os 448 GB/s são iguais, só a capacidade muda. Com 8 GB, Qwen 3.5 9B (6,6 GB) deixa apenas 1,4 GB de margem; com 16 GB, gpt-oss 20B (14 GB) e Qwen3 14B (9,3 GB) cabem com contexto.
Quantos tokens por segundo em uma RTX 5060 Ti?+
De acordo com o Hardware Corner, a versão de 16 GB gera 41,1 tokens por segundo no Qwen3 14B com 4k de contexto, 69,2 no Qwen3 8B e 92,1 no gpt-oss 20B. O contexto torna a geração mais lenta: o Qwen3 14B cai para 25,9 tokens por segundo com 32k. Esses valores são medições de terceiros.
A RTX 5060 Ti 16 GB consegue rodar um modelo de 24 ou 32 bilhões?+
Um modelo de 24B em Q4 (Devstral Small 2, 15 GB) cabe por pouco, com 1 GB de margem, portanto sem contexto útil. Um modelo de 27B ou 32B (17 a 20 GB) não cabe. O Hardware Corner indica que um modelo de 30B só cabe em 3 bits, com uma degradação clara da qualidade.
Qual fonte de alimentação para uma RTX 5060 Ti?+
A NVIDIA indica uma fonte de alimentação de 600 W como requisito do sistema para a 5060 Ti, com 180 W de potência gráfica. Esses são os valores do fabricante para um PC completo. Uma fonte de 550 W, frequentemente citada, fica abaixo dessa recomendação, embora possa ser suficiente em um PC de baixo consumo.
RTX 5060 Ti ou RTX 4060 Ti 16 GB para os LLM?+
A 5060 Ti gera cerca de 47% mais rápido, com a mesma capacidade de 16 GB: a 4060 Ti atinge 68% da sua taxa de geração, segundo o Hardware Corner, devido à largura de banda de 288 GB/s contra 448 GB/s. Compare a diferença de preço antes de escolher: com um orçamento reduzido, uma 4060 Ti usada continua sendo utilizável.
É possível fazer fine-tuning de um modelo em uma RTX 5060 Ti de 16 GB?+
Sim, até 14 bilhões com QLoRA. De acordo com o Unsloth, o mínimo absoluto é de 6 GB para um 8B e 8,5 GB para um 14B, com lote de 1 e contexto curto. Um 27B exige 22 GB e não cabe. A versão de 8 GB é limitada a 8B ou 9B.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.