Iniciante 11 minRTX 50

Qual LLM na RTX 5060 (8 GB) ?

Resposta direta

A RTX 5060 associa 8 GB de GDDR7 a 448 GB/s, ou seja, 65% mais largura de banda do que uma RTX 4060. Ela executa sem problemas modelos de 3 a 9 bilhões de parâmetros em Q4: Granite 4.2 8B (5,3 GB) ou Qwen 3.5 9B (6,6 GB), com um limite teórico de cerca de 85 tokens/s em um 8B. Sua limitação é a capacidade: um modelo de 12B ou maior não cabe com contexto útil.

A RTX 5060 é a placa de 8 GB mais rápida do mercado de consumo para LLMs locais, graças à sua memória GDDR7. Mas 8 GB continuam sendo 8 GB. Este guia apresenta em números o que cabe, a velocidade que se pode esperar, os ajustes do Ollama que evitam exceder a capacidade da VRAM e o momento em que uma RTX 5060 Ti 16 GB se torna uma compra melhor.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux
Hardware recomendado

Para este setup: RTX 5060 Ti 16 GB.

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#RTX 5060 para um LLM local: o que 8 GB de GDDR7 permitem

Uma RTX 5060 consegue rodar sem problemas modelos com entre 3 e 9 bilhões de parâmetros em Q4. Qwen 3.5 4B pesa 3,4 GB, Granite 4.2 8B 5,3 GB e Qwen 3.5 9B 6,6 GB de acordo com a biblioteca Ollama: todos cabem nos 8 GB da placa, o último com um contexto curto. Um modelo de 12B, como Gemma 4 12B (7,7 a 8 GB), já ocupa toda a memória antes do primeiro token de contexto. O ponto forte da placa é sua memória: 448 GB/s em um barramento de 128 bits, contra 272 GB/s da RTX 4060, ou seja, 65% a mais. Para bate-papo, resumos ou um pequeno RAG, a 5060 se sai muito bem. Para ultrapassar 9B, é necessário mais VRAM, não mais velocidade.

Arquitetura
Blackwell, 3.840 núcleos CUDA e Tensor Cores da 5ª geração de acordo com NVIDIA
Memória
8 GB de GDDR7 em um barramento de 128 bits, 448 GB/s de largura de banda.
Potência
145 W de potência gráfica total; a NVIDIA indica uma fonte de alimentação de no mínimo 550 W para o PC inteiro.
Preço de lançamento
299 dólares, lançamento em 19 de maio de 2025 de acordo com a Wikipedia.

#Por que a 5060 é mais rápida que a 4060 com a mesma capacidade

Na geração, cada token obriga a GPU a reler a maior parte dos pesos do modelo. A velocidade máxima é, portanto, a largura de banda dividida pelo tamanho dos pesos. A 5060 lê sua memória 65% mais rápido que a 4060: com o mesmo modelo, o limite teórico aumenta na mesma proporção. É o único argumento técnico que conta para o LLM. Os núcleos CUDA ajudam na leitura do prompt, não na geração, que continua limitada pela memória.

Placas de 8 GB: largura de banda e limite para um modelo de 5,3 GB
PlacaMemóriaLargura de bandaLimite para um modelo de 5,3 GB
RTX 40608 GB GDDR6272 GB/s51 tokens/s
RTX 50608 GB GDDR7448 GB/s85 tokens/s

#Quais modelos cabem em 8 GB

Modelos para RTX 5060 (tamanhos no Ollama, apenas os pesos)
ModeloTamanhoMargem com 8 GBVeredito
Qwen 3.5 4B3,4 GB4,6 GBConfortável, contexto longo possível
Granite 4.2 8B5,3 GB2,7 GBConfortável, contexto moderado
Qwen 3.5 9B6,6 GB1,4 GBApertado, contexto curto
Gemma 4 12B7,7 a 8,0 GB0 GB ou menosNão cabe na memória com um contexto útil

Gemma 4 12B ilustra a armadilha do tamanho do arquivo: seus pesos ocupam 7,7 a 8 GB, mas a placa também precisa acomodar o cache de contexto e a memória usada para exibir a imagem na tela. O modelo carrega, mas com um contexto de alguns milhares de tokens na melhor das hipóteses, e parte dele passa para a RAM assim que um aplicativo consome um pouco de VRAM. Com 8 GB, Qwen 3.5 9B ou Granite 4.2 8B são opções mais seguras e deixam uma margem utilizável.

#Imagens, visão e quantização: dois esclarecimentos

A biblioteca Ollama indica que Qwen 3.5 aceita texto e imagem: um modelo de 4B ou de 9B pode, portanto, descrever uma captura de tela ou ler um esquema. As imagens consomem contexto, o que reduz a margem em 8 GB; prefira o 4B (3,4 GB) para visão se quiser manter espaço. Quanto à quantização, Q4_K_M continua o bom equilíbrio em 8 GB: passar para uma quantização mais fina aumenta o peso em centenas de megabytes, margem que a placa não tem, sem alteração visível para uso comum.

#Instalar Ollama e verificar a placa

  1. 01
    Driver NVIDIA
    Ollama exige um driver NVIDIA 550 ou mais recente. Para uma RTX 50, instale o driver mais recente oferecido por NVIDIA. Verifique com nvidia-smi.
  2. 02
    Instalar Ollama
    A RTX 5060 está listada entre as placas suportadas (capacidade de cálculo 12.0). O CUDA está integrado: nenhuma instalação separada é necessária.
  3. 03
    Primeiro modelo
    Inicie ollama run qwen3.5:9b (6,6 GB) ou ollama run granite4.2:8b (5,3 GB) se você preferir manter margem.
  4. 04
    Controle
    Execute o ollama ps: a coluna PROCESSOR deve mostrar 100 % GPU.

#Que velocidade esperar: um limite superior, não uma medição

Nenhuma taxa de geração é apresentada aqui como uma medição própria. O teto de geração é a largura de banda dividida pelo tamanho dos pesos. Uma medição pública de terceiros (LLaMA 3 8B em Q4_K_M com llama.cpp, maio de 2024) registra 106 tokens/s em uma RTX 4080 cujo teto é de 156 tokens/s, ou seja, aproximadamente 68%. Adotando 70% como ordem de grandeza, obtêm-se as seguintes estimativas para um contexto curto.

Limite teórica com RTX 5060 (448 GB/s)
Modelo (Q4)Tamanho do modeloTetoEstimativa em 70 %
Qwen 3.5 4B3,4 GB132 tokens/saproximadamente 92 tokens/s
Granite 4.2 8B5,3 GB85 tokens/scerca de 59 tokens/s
Qwen 3.5 9B6,6 GB68 tokens/scerca de 48 tokens/s
Gemma 4 12B7,7 GB58 tokens/saproximadamente 40 tokens/s, contexto muito limitado

Todos esses limites máximos ficam bem acima do limiar de leitura confortável, em torno de 15 a 20 tokens/s. A velocidade, portanto, não será o fator limitante para a 5060: será a capacidade de 8 GB.

#Ajustar o Ollama para não ultrapassar os 8 GB

Ollama quantiza o cache K/V em q8_0 para usar aproximadamente metade da memória do f16, valor padrão, com perda de precisão muito baixa de acordo com sua documentação; isso exige Flash Attention. Com 8 GB, essa é a medida com o melhor custo-benefício: permite ampliar o contexto sem mudar de modelo.

Configurações do servidor Ollama (Linux, macOS)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_CONTEXT_LENGTH=8192
ollama serve
Um único modelo
Apenas carregue um modelo de cada vez; um modelo de embeddings para um RAG deve permanecer pequeno.
Aplicativos que consomem muitos recursos
Navegadores com aceleração de hardware, jogos e codificação de vídeo reservam VRAM: feche-os antes de carregar.
Contexto adaptado
Cada duplicação do contexto duplica o cache K/V: aumente apenas quando a tarefa o exigir.
Monitoramento
nvidia-smi durante uma geração longa mostra a margem real.

#O que se faz concretamente com 8 GB

O bom critério é o trabalho exigido, não o tamanho do modelo. Um chat ou uma reformulação funcionam em um 4B assim como em um 8B. Um resumo de documentos de algumas dezenas de páginas requer um contexto de 8 000 a 16 000 tokens: com o cache K/V em q8_0, um 8B consegue isso em 8 GB. Um RAG combina um modelo de geração, um modelo de embeddings e o contexto dos trechos recuperados: mantenha o modelo de geração abaixo de 9B. O assistente de código é o caso mais exigente, pois os modelos especializados rapidamente excedem a capacidade da placa.

Usos na RTX 5060 (8 GB)
UsoRealista?Ajuste recomendado
Chat diário, perguntas curtasSimGranite 4.2 8B, contexto padrão
Resumo de documentos de 10 a 30 páginasSim, com um contexto de 8.192 a 16.384 tokensCache K/V em q8_0, Flash Attention
RAG em seus arquivosSim, com um modelo de 4B a 8BEmbeddings leves, um único modelo de geração
Assistente de código em um repositórioLimitadoModelo de 4B a 8B, trechos curtos
Modelos de 14 GB ou maisNãoPrever 16 GB de VRAM

Se um modelo exceder a capacidade da VRAM, a geração não para: parte dos pesos é lida da RAM do sistema. O sintoma é uma queda brusca na taxa de geração. O comando ollama ps mostra a distribuição entre GPU e CPU; uma linha com 100% na GPU indica funcionamento normal, enquanto uma linha dividida entre GPU e CPU indica que o modelo excedeu a capacidade da VRAM, o que se corrige reduzindo o contexto ou trocando de modelo.

#Quando a 5060 já não é suficiente

Três sinais indicam que é preciso mais memória. Você quer um modelo de 12B ou mais para redação de qualidade. Seu contexto ultrapassa regularmente 16 000 tokens devido a documentos longos. Você carrega vários modelos ao mesmo tempo: geração, embeddings e reranker. Nesses casos, aumentar a velocidade não muda nada: o que falta é capacidade, e os próximos níveis são descritos nas páginas de 12 GB e 16 GB.

#5060 ou 5060 Ti 16 GB: a escolha que realmente importa

A RTX 5060 Ti 16 GB utiliza a mesma memória GDDR7 em um barramento de 128 bits, portanto a mesma largura de banda de 448 GB/s segundo a Wikipedia. Seus 4.608 núcleos CUDA e 16 GB de memória são suas verdadeiras diferenças. Ela gera, portanto, à mesma velocidade com um modelo que cabe nas duas placas, mas também carrega modelos de 14 GB que a 5060 não consegue acomodar. Os preços sugeridos no lançamento eram de 299 dólares para a 5060, 379 dólares para a 5060 Ti 8 GB e 429 dólares para a 5060 Ti 16 GB: a diferença de 130 dólares compra o dobro da capacidade.

RTX 5060 e RTX 5060 Ti: o que muda para o LLM
CritérioRTX 5060RTX 5060 Ti 16 GB
Memória8 GB GDDR716 GB GDDR7
Largura de banda448 GB/s448 GB/s
Núcleos CUDA3 8404 608
Potência gráfica145 W180 W
Fonte de alimentação mínima550 W600 W
Modelos de 14 GB (gpt-oss 20B, Mistral Small 24B)NãoSim, com 2 GB de margem

#Veredito 2026

Compre uma 5060 se
Seus modelos têm entre 4B e 9B, o orçamento é apertado e você quer uma placa nova com garantia. É a placa de 8 GB mais rápida.
Prefira a 5060 Ti 16 GB se
Você busca modelos de 12B a 24B: a capacidade tem prioridade sobre a velocidade, e o custo adicional é modesto.
Evite a 5060 se
Você pretende usar Gemma 4 12B, gpt-oss 20B ou qualquer modelo acima de 8 GB de forma séria.

O resumo cabe em uma frase: a 5060 é a placa de 8 GB que você escolhe por sua velocidade e preço, não pela capacidade. Se seu uso couber em 8 GB, ela é difícil de superar entre as placas novas; se não couber, nenhum ajuste compensará os 8 GB faltantes, e a próxima placa da linha é o investimento certo.

#Perguntas frequentes

FAQ
A RTX 5060 pode rodar um LLM localmente?+
Sim, até aproximadamente 9 bilhões de parâmetros em Q4. O Granite 4.2 8B (5,3 GB) e o Qwen 3.5 9B (6,6 GB) cabem em seus 8 GB de VRAM. Acima disso, como o Gemma 4 12B (7,7 a 8 GB), não sobra espaço para o contexto e parte do modelo é transferida para a RAM do sistema.
Quantos tokens por segundo em uma RTX 5060?+
Nenhuma medição confiável é publicada aqui. O limite teórico, banda passante de 448 GB/s dividida pelo tamanho do modelo, é de cerca de 85 tokens/s para Granite 4.2 8B (5,3 GB), ou cerca de 59 tokens/s a 70% desse limite. É uma estimativa que diminui quando o contexto se alonga.
RTX 5060 ou RTX 4060 Ti de 16 GB para um LLM?+
Para modelos que cabem em 8 GB, a 5060 é mais rápida: 448 GB/s contra 288 GB/s. Para modelos de 14 GB, como gpt-oss 20B, apenas a 4060 Ti 16 GB é adequada. A escolha depende, portanto, primeiro do tamanho desejado e depois do preço da 4060 Ti usada.
O FP4 da RTX 5060 acelera Ollama?+
A NVIDIA destaca o FP4 nos Tensor Cores da quinta geração. Modelos comuns do Ollama, em Q4_K_M, não estão no formato FP4: nenhum ganho desse tipo é documentado aqui. O fator que acelera a geração é a largura de banda de 448 GB/s.
Qual fonte de alimentação para uma RTX 5060?+
A NVIDIA indica 145 W de potência gráfica total e uma fonte de alimentação de no mínimo 550 W para o computador inteiro. Esse valor inclui a margem para o processador e os picos de consumo. Uma fonte de qualidade de 550 W é suficiente; a 5060 Ti exige 600 W.
É possível fazer RAG com uma RTX 5060?+
Sim, com um modelo de geração de 4B a 8B e um modelo de embeddings leve. Mantenha apenas um modelo de geração carregado, ative o cache K/V em q8_0 e limite o contexto ao que seus trechos exigem. Acima disso, a capacidade de 8 GB se torna o fator limitante.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.