Qual LLM na RTX 5060 (8 GB) ?
A RTX 5060 associa 8 GB de GDDR7 a 448 GB/s, ou seja, 65% mais largura de banda do que uma RTX 4060. Ela executa sem problemas modelos de 3 a 9 bilhões de parâmetros em Q4: Granite 4.2 8B (5,3 GB) ou Qwen 3.5 9B (6,6 GB), com um limite teórico de cerca de 85 tokens/s em um 8B. Sua limitação é a capacidade: um modelo de 12B ou maior não cabe com contexto útil.
A RTX 5060 é a placa de 8 GB mais rápida do mercado de consumo para LLMs locais, graças à sua memória GDDR7. Mas 8 GB continuam sendo 8 GB. Este guia apresenta em números o que cabe, a velocidade que se pode esperar, os ajustes do Ollama que evitam exceder a capacidade da VRAM e o momento em que uma RTX 5060 Ti 16 GB se torna uma compra melhor.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Para este setup: RTX 5060 Ti 16 GB.
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#RTX 5060 para um LLM local: o que 8 GB de GDDR7 permitem
Uma RTX 5060 consegue rodar sem problemas modelos com entre 3 e 9 bilhões de parâmetros em Q4. Qwen 3.5 4B pesa 3,4 GB, Granite 4.2 8B 5,3 GB e Qwen 3.5 9B 6,6 GB de acordo com a biblioteca Ollama: todos cabem nos 8 GB da placa, o último com um contexto curto. Um modelo de 12B, como Gemma 4 12B (7,7 a 8 GB), já ocupa toda a memória antes do primeiro token de contexto. O ponto forte da placa é sua memória: 448 GB/s em um barramento de 128 bits, contra 272 GB/s da RTX 4060, ou seja, 65% a mais. Para bate-papo, resumos ou um pequeno RAG, a 5060 se sai muito bem. Para ultrapassar 9B, é necessário mais VRAM, não mais velocidade.
- Arquitetura
- Blackwell, 3.840 núcleos CUDA e Tensor Cores da 5ª geração de acordo com NVIDIA
- Memória
- 8 GB de GDDR7 em um barramento de 128 bits, 448 GB/s de largura de banda.
- Potência
- 145 W de potência gráfica total; a NVIDIA indica uma fonte de alimentação de no mínimo 550 W para o PC inteiro.
- Preço de lançamento
- 299 dólares, lançamento em 19 de maio de 2025 de acordo com a Wikipedia.
#Por que a 5060 é mais rápida que a 4060 com a mesma capacidade
Na geração, cada token obriga a GPU a reler a maior parte dos pesos do modelo. A velocidade máxima é, portanto, a largura de banda dividida pelo tamanho dos pesos. A 5060 lê sua memória 65% mais rápido que a 4060: com o mesmo modelo, o limite teórico aumenta na mesma proporção. É o único argumento técnico que conta para o LLM. Os núcleos CUDA ajudam na leitura do prompt, não na geração, que continua limitada pela memória.
| Placa | Memória | Largura de banda | Limite para um modelo de 5,3 GB |
|---|---|---|---|
| RTX 4060 | 8 GB GDDR6 | 272 GB/s | 51 tokens/s |
| RTX 5060 | 8 GB GDDR7 | 448 GB/s | 85 tokens/s |
#Quais modelos cabem em 8 GB
| Modelo | Tamanho | Margem com 8 GB | Veredito |
|---|---|---|---|
| Qwen 3.5 4B | 3,4 GB | 4,6 GB | Confortável, contexto longo possível |
| Granite 4.2 8B | 5,3 GB | 2,7 GB | Confortável, contexto moderado |
| Qwen 3.5 9B | 6,6 GB | 1,4 GB | Apertado, contexto curto |
| Gemma 4 12B | 7,7 a 8,0 GB | 0 GB ou menos | Não cabe na memória com um contexto útil |
Gemma 4 12B ilustra a armadilha do tamanho do arquivo: seus pesos ocupam 7,7 a 8 GB, mas a placa também precisa acomodar o cache de contexto e a memória usada para exibir a imagem na tela. O modelo carrega, mas com um contexto de alguns milhares de tokens na melhor das hipóteses, e parte dele passa para a RAM assim que um aplicativo consome um pouco de VRAM. Com 8 GB, Qwen 3.5 9B ou Granite 4.2 8B são opções mais seguras e deixam uma margem utilizável.
#Imagens, visão e quantização: dois esclarecimentos
A biblioteca Ollama indica que Qwen 3.5 aceita texto e imagem: um modelo de 4B ou de 9B pode, portanto, descrever uma captura de tela ou ler um esquema. As imagens consomem contexto, o que reduz a margem em 8 GB; prefira o 4B (3,4 GB) para visão se quiser manter espaço. Quanto à quantização, Q4_K_M continua o bom equilíbrio em 8 GB: passar para uma quantização mais fina aumenta o peso em centenas de megabytes, margem que a placa não tem, sem alteração visível para uso comum.
#Instalar Ollama e verificar a placa
- 01Driver NVIDIAOllama exige um driver NVIDIA 550 ou mais recente. Para uma RTX 50, instale o driver mais recente oferecido por NVIDIA. Verifique com nvidia-smi.
- 02Instalar OllamaA RTX 5060 está listada entre as placas suportadas (capacidade de cálculo 12.0). O CUDA está integrado: nenhuma instalação separada é necessária.
- 03Primeiro modeloInicie ollama run qwen3.5:9b (6,6 GB) ou ollama run granite4.2:8b (5,3 GB) se você preferir manter margem.
- 04ControleExecute o ollama ps: a coluna PROCESSOR deve mostrar 100 % GPU.
#Que velocidade esperar: um limite superior, não uma medição
Nenhuma taxa de geração é apresentada aqui como uma medição própria. O teto de geração é a largura de banda dividida pelo tamanho dos pesos. Uma medição pública de terceiros (LLaMA 3 8B em Q4_K_M com llama.cpp, maio de 2024) registra 106 tokens/s em uma RTX 4080 cujo teto é de 156 tokens/s, ou seja, aproximadamente 68%. Adotando 70% como ordem de grandeza, obtêm-se as seguintes estimativas para um contexto curto.
| Modelo (Q4) | Tamanho do modelo | Teto | Estimativa em 70 % |
|---|---|---|---|
| Qwen 3.5 4B | 3,4 GB | 132 tokens/s | aproximadamente 92 tokens/s |
| Granite 4.2 8B | 5,3 GB | 85 tokens/s | cerca de 59 tokens/s |
| Qwen 3.5 9B | 6,6 GB | 68 tokens/s | cerca de 48 tokens/s |
| Gemma 4 12B | 7,7 GB | 58 tokens/s | aproximadamente 40 tokens/s, contexto muito limitado |
Todos esses limites máximos ficam bem acima do limiar de leitura confortável, em torno de 15 a 20 tokens/s. A velocidade, portanto, não será o fator limitante para a 5060: será a capacidade de 8 GB.
#Ajustar o Ollama para não ultrapassar os 8 GB
Ollama quantiza o cache K/V em q8_0 para usar aproximadamente metade da memória do f16, valor padrão, com perda de precisão muito baixa de acordo com sua documentação; isso exige Flash Attention. Com 8 GB, essa é a medida com o melhor custo-benefício: permite ampliar o contexto sem mudar de modelo.
- Um único modelo
- Apenas carregue um modelo de cada vez; um modelo de embeddings para um RAG deve permanecer pequeno.
- Aplicativos que consomem muitos recursos
- Navegadores com aceleração de hardware, jogos e codificação de vídeo reservam VRAM: feche-os antes de carregar.
- Contexto adaptado
- Cada duplicação do contexto duplica o cache K/V: aumente apenas quando a tarefa o exigir.
- Monitoramento
- nvidia-smi durante uma geração longa mostra a margem real.
#O que se faz concretamente com 8 GB
O bom critério é o trabalho exigido, não o tamanho do modelo. Um chat ou uma reformulação funcionam em um 4B assim como em um 8B. Um resumo de documentos de algumas dezenas de páginas requer um contexto de 8 000 a 16 000 tokens: com o cache K/V em q8_0, um 8B consegue isso em 8 GB. Um RAG combina um modelo de geração, um modelo de embeddings e o contexto dos trechos recuperados: mantenha o modelo de geração abaixo de 9B. O assistente de código é o caso mais exigente, pois os modelos especializados rapidamente excedem a capacidade da placa.
| Uso | Realista? | Ajuste recomendado |
|---|---|---|
| Chat diário, perguntas curtas | Sim | Granite 4.2 8B, contexto padrão |
| Resumo de documentos de 10 a 30 páginas | Sim, com um contexto de 8.192 a 16.384 tokens | Cache K/V em q8_0, Flash Attention |
| RAG em seus arquivos | Sim, com um modelo de 4B a 8B | Embeddings leves, um único modelo de geração |
| Assistente de código em um repositório | Limitado | Modelo de 4B a 8B, trechos curtos |
| Modelos de 14 GB ou mais | Não | Prever 16 GB de VRAM |
Se um modelo exceder a capacidade da VRAM, a geração não para: parte dos pesos é lida da RAM do sistema. O sintoma é uma queda brusca na taxa de geração. O comando ollama ps mostra a distribuição entre GPU e CPU; uma linha com 100% na GPU indica funcionamento normal, enquanto uma linha dividida entre GPU e CPU indica que o modelo excedeu a capacidade da VRAM, o que se corrige reduzindo o contexto ou trocando de modelo.
#Quando a 5060 já não é suficiente
Três sinais indicam que é preciso mais memória. Você quer um modelo de 12B ou mais para redação de qualidade. Seu contexto ultrapassa regularmente 16 000 tokens devido a documentos longos. Você carrega vários modelos ao mesmo tempo: geração, embeddings e reranker. Nesses casos, aumentar a velocidade não muda nada: o que falta é capacidade, e os próximos níveis são descritos nas páginas de 12 GB e 16 GB.
#5060 ou 5060 Ti 16 GB: a escolha que realmente importa
A RTX 5060 Ti 16 GB utiliza a mesma memória GDDR7 em um barramento de 128 bits, portanto a mesma largura de banda de 448 GB/s segundo a Wikipedia. Seus 4.608 núcleos CUDA e 16 GB de memória são suas verdadeiras diferenças. Ela gera, portanto, à mesma velocidade com um modelo que cabe nas duas placas, mas também carrega modelos de 14 GB que a 5060 não consegue acomodar. Os preços sugeridos no lançamento eram de 299 dólares para a 5060, 379 dólares para a 5060 Ti 8 GB e 429 dólares para a 5060 Ti 16 GB: a diferença de 130 dólares compra o dobro da capacidade.
| Critério | RTX 5060 | RTX 5060 Ti 16 GB |
|---|---|---|
| Memória | 8 GB GDDR7 | 16 GB GDDR7 |
| Largura de banda | 448 GB/s | 448 GB/s |
| Núcleos CUDA | 3 840 | 4 608 |
| Potência gráfica | 145 W | 180 W |
| Fonte de alimentação mínima | 550 W | 600 W |
| Modelos de 14 GB (gpt-oss 20B, Mistral Small 24B) | Não | Sim, com 2 GB de margem |
#Veredito 2026
- Compre uma 5060 se
- Seus modelos têm entre 4B e 9B, o orçamento é apertado e você quer uma placa nova com garantia. É a placa de 8 GB mais rápida.
- Prefira a 5060 Ti 16 GB se
- Você busca modelos de 12B a 24B: a capacidade tem prioridade sobre a velocidade, e o custo adicional é modesto.
- Evite a 5060 se
- Você pretende usar Gemma 4 12B, gpt-oss 20B ou qualquer modelo acima de 8 GB de forma séria.
O resumo cabe em uma frase: a 5060 é a placa de 8 GB que você escolhe por sua velocidade e preço, não pela capacidade. Se seu uso couber em 8 GB, ela é difícil de superar entre as placas novas; se não couber, nenhum ajuste compensará os 8 GB faltantes, e a próxima placa da linha é o investimento certo.
- Fonte: características oficiais NVIDIA (RTX 5060 e 5060 Ti)
- Fonte: GPUs NVIDIA com suporte no Ollama
- Fonte: FAQ oficial do Ollama (Flash Attention, cache K/V)
#Perguntas frequentes
A RTX 5060 pode rodar um LLM localmente?+
Quantos tokens por segundo em uma RTX 5060?+
RTX 5060 ou RTX 4060 Ti de 16 GB para um LLM?+
O FP4 da RTX 5060 acelera Ollama?+
Qual fonte de alimentação para uma RTX 5060?+
É possível fazer RAG com uma RTX 5060?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.