Qual LLM na RTX 4060 (8 GB) ?
Uma RTX 4060 (8 GB de GDDR6, 272 GB/s) executa sem problemas modelos de 3 a 9 bilhões de parâmetros em Q4: Qwen 3.5 4B (3,4 GB), Granite 4.2 8B (5,3 GB) ou Qwen 3.5 9B (6,6 GB). Ela fica lenta quando um modelo e seu contexto ultrapassam 8 GB. Sua largura de banda impõe um limite teórico de cerca de 50 tokens/s em um 8B em Q4. Acima disso, são os 12 ou 16 GB que mudam o uso, não a velocidade do GPU.
A RTX 4060 é a placa de entrada da geração Ada: 8 GB de VRAM, 115 W e preço baixo no mercado de usados. Ela é suficiente para experimentar LLMs locais, desde que você conheça seu limite exato. Este guia quantifica o que cabe em seus 8 GB, o que sua largura de banda permite, como ajustar o Ollama para não exceder essa capacidade e quando vale mais a pena passar para uma placa de 12 ou 16 GB.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Opção de compra para este guia: RTX 5060 Ti 16 GB.
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#A RTX 4060 para um LLM local: o que ela permite
Em uma RTX 4060, um LLM local funciona bem desde que o modelo, seu contexto e o sistema caibam em 8 GB de VRAM. Em Q4, isso abrange modelos com 3 a 9 bilhões de parâmetros: Qwen 3.5 4B pesa 3,4 GB, Granite 4.2 8B 5,3 GB e Qwen 3.5 9B 6,6 GB de acordo com a biblioteca Ollama. Um modelo de 12B como Gemma 4 12B (7,7 a 8 GB) já ocupa toda a placa antes mesmo de contar o contexto. A largura de banda de 272 GB/s determina a velocidade: ela estabelece um limite teórico de cerca de 51 tokens/s em um modelo de 5,3 GB, e a velocidade real fica abaixo desse limite. Para um assistente de chat, resumo ou um pequeno RAG, isso é suficiente. Para trabalhar com código em um grande repositório ou realizar raciocínios longos, é insuficiente.
- Arquitetura
- Ada Lovelace, 3.072 núcleos CUDA, Tensor Cores da 4ª geração, capacidade de cálculo CUDA 8.9.
- Memória
- 8 GB de GDDR6 em um barramento de 128 bits, ou seja, 272 GB/s de largura de banda (fonte: Wikipedia, tabela da série GeForce 40).
- Consumo
- 115 W de potência gráfica total; a NVIDIA indica uma fonte de alimentação de no mínimo 550 W para o computador inteiro.
- Interface
- PCIe 4.0 limitado a 8 pistas: um modelo que não cabe na VRAM e passa a usar a RAM trafega por uma conexão estreita, o que penaliza ainda mais o offload.
- Disponibilidade
- Lançada em 2023, a placa é encontrada principalmente no mercado de usados; os preços são acompanhados na página dedicada.
#Quais modelos cabem em 8 GB
A referência do site em Q4 é simples: cerca de 0,6 GB por bilhão de parâmetros, considerando apenas os pesos. É preciso acrescentar o cache de contexto (KV cache) e uma margem para a exibição e o sistema. O Ollama usa por padrão um contexto de 4.096 tokens, que ainda ocupa pouca memória; com 16.000 tokens, o cache passa a representar uma parcela importante do uso de memória. A tabela abaixo reúne os tamanhos publicados pelo Ollama e indica a margem restante em 8 GB, antes de considerar o contexto.
| Modelo | Tamanho do Ollama | Margem com 8 GB | Veredito |
|---|---|---|---|
| Qwen 3.5 4B | 3,4 GB | 4,6 GB | Confortável, contexto longo possível |
| Granite 4.2 8B | 5,3 GB | 2,7 GB | Confortável até cerca de 16.000 tokens com cache quantizado |
| Qwen 3.5 9B | 6,6 GB | 1,4 GB | Apertado: contexto curto, aplicativos fechados |
| Gemma 4 12B | 7,7 a 8,0 GB | 0 GB ou menos | Não cabe na memória com um contexto útil |
| gpt-oss 20B | 14 GB | Negativo | Não cabe apenas na VRAM |
| Mistral Small 24B | 14 GB | Negativo | Não cabe apenas na VRAM |
Duas armadilhas aparecem com frequência. A primeira: o tamanho do arquivo não corresponde à memória necessária, pois o contexto exige memória adicional. A segunda: um modelo que excede a capacidade da VRAM não trava; ele é carregado parcialmente na RAM do sistema e fica muito mais lento. O comando ollama ps exibe a distribuição: uma linha com 100 % na GPU indica uma situação normal; uma linha dividida entre CPU/GPU indica que parte do modelo foi carregada fora da VRAM.
#Instalar Ollama e iniciar um primeiro modelo
- 01Verificar o driver NVIDIAOllama exige um driver NVIDIA 550 ou mais recente para placas com capacidade de computação 5.0 ou superior. Uma RTX 4060 (capacidade 8.9) é explicitamente listada na documentação do Ollama. Verifique a versão com nvidia-smi.
- 02Instalar OllamaSiga o guia de instalação para seu sistema. O CUDA está embutido, nenhuma instalação separada do toolkit é necessária.
- 03Iniciar um modelo adequadoComece com ollama run granite4.2:8b (5,3 GB) ou ollama run qwen3.5:9b (6,6 GB). Em seguida, execute o comando ollama ps em um segundo terminal.
- 04Verificar o posicionamentoA coluna PROCESSOR deve mostrar 100 % GPU. Caso contrário, reduza o contexto ou mude para um modelo menor.
#Qual velocidade esperar: o limite, não a promessa
Não há aqui medições próprias, e nenhum número de desempenho é apresentado como resultado de uma medição própria. No entanto, é possível calcular um teto: a largura de banda dividida pelo tamanho dos pesos lidos a cada token. Um levantamento de terceiros publicado no GitHub (LLaMA 3 8B em Q4_K_M com llama.cpp, retrato de maio de 2024) apresenta razões entre o desempenho observado e o teto de 68% em uma RTX 4080 e de 75% em uma RTX 4070 Ti. Ordem de grandeza razoável: 70% do teto. Esses valores continuam sendo estimativas, válidas para um contexto curto.
| Modelo (Q4) | Tamanho do modelo | Limite teórica | Estimativa em 70 % |
|---|---|---|---|
| Qwen 3.5 4B | 3,4 GB | 80 tokens/s | cerca de 56 tokens/s |
| Granite 4.2 8B | 5,3 GB | 51 tokens/s | aproximadamente 36 tokens/s |
| Qwen 3.5 9B | 6,6 GB | 41 tokens/s | cerca de 29 tokens/s |
Essas estimativas são coerentes com o uso de um assistente de chat: a leitura é confortável a partir de 15 a 20 tokens/s. Elas não levam em conta o contexto, que torna a geração mais lenta à medida que cresce, nem o tempo de processamento do prompt, que pesa no processamento computacional e não na memória.
#Ajustar o Ollama para não ultrapassar os 8 GB
Os ajustes que importam são os do contexto e do cache. O Ollama quantiza o cache K/V em q8_0 para usar aproximadamente metade da memória do f16, com uma perda de precisão muito baixa de acordo com sua documentação; isso exige Flash Attention. Com 8 GB, é o ajuste que mais compensa: permite aumentar o contexto sem mudar de modelo.
- Contexto razoável
- Aumente o contexto para 8.192 ou 16.384 tokens somente se o uso exigir: cada duplicação do contexto duplica o cache K/V.
- Apenas um modelo carregado
- Em 8 GB, mantenha apenas um modelo na memória; um modelo de embeddings para um RAG deve ser pequeno.
- Liberar a VRAM
- O ambiente de trabalho, o navegador e os jogos reservam VRAM. Feche-os antes de carregar um modelo e verifique com nvidia-smi.
- Quantização
- Continue usando Q4_K_M: um modelo de 8B em Q8 (cerca de 8,5 GB) excede a capacidade de memória da placa.
#O que a 4060 faz bem, mal ou não faz
O veredito depende mais do uso do que da placa. Uma conversa curta ou um resumo de algumas páginas fica dentro da zona de conforto, tanto em um modelo de 4B quanto em um de 8B. Um RAG exige um modelo de geração, um modelo de embeddings e um contexto longo o suficiente para conter os trechos recuperados: com 8 GB, é preciso escolher um modelo de geração de 4B a 8B e manter o modelo de embeddings pequeno. O assistente de código é mais exigente, pois os modelos especializados e seus contextos de vários milhares de tokens rapidamente excedem a capacidade da placa.
| Uso | Realista? | Ajuste recomendado |
|---|---|---|
| Chat diário, perguntas curtas | Sim | Granite 4.2 8B ou Qwen 3.5 4B, contexto padrão |
| Resumo de documentos de 10 a 20 páginas | Sim, com um contexto de 8.192 a 16.384 | Cache K/V em q8_0, Flash Attention ativada |
| RAG em seus arquivos | Sim, modelo 4B a 8B | Embeddings leves, apenas um modelo de geração carregado |
| Assistente de código em um repositório | Limitado | Modelo de 4B a 8B, trechos curtos, sem incluir o repositório inteiro |
| Modelo de 20B ou mais, incluindo gpt-oss 20B | Não | Prever no mínimo 16 GB de VRAM |
O caso de gpt-oss 20B ilustra esse limite: o Ollama indica 14 GB para esse modelo, e sua ficha informa que a quantização MXFP4 permite executá-lo a partir de 16 GB de memória. Uma placa de 8 GB não se enquadra nessa configuração, independentemente de sua velocidade de processamento.
#Quando passar para outra placa
Três sinais indicam que os 8 GB se tornam um obstáculo. Você quer um modelo de 12B ou mais, incluindo Gemma 4 12B. Você trabalha com documentos longos, onde o contexto excede 16 000 tokens. Você usa um assistente de código que carrega um modelo de 14 a 24 GB. Nesses casos, adicionar velocidade não resolve nada: falta capacidade de memória, e a página dedicada aos 8 GB, aos 12 GB e aos 16 GB ajuda você a escolher o nível certo.
#4060, 3060 12 GB, 5060: o equilíbrio certo
| Placa | VRAM | Largura de banda | O que isso muda |
|---|---|---|---|
| RTX 3060 12 GB | 12 GB | 360 GB/s | Mais VRAM: Gemma 4 12B cabe, mas o barramento é mais antigo |
| RTX 4060 | 8 GB | 272 GB/s | Consumo baixo, limite de 8B-9B |
| RTX 5060 | 8 GB | 448 GB/s | Mesma capacidade, limite de velocidade 65 % superior |
A RTX 3060 12 GB oferece 4 GB de memória a mais e uma largura de banda maior (360 GB/s segundo a Wikipedia). No mercado de usados, ela geralmente custa menos: consulte /prix-gpu-ia para conferir a situação do mercado. A RTX 5060 mantém 8 GB, mas lê a memória 65 % mais rápido. Se o seu uso couber em 8 GB, a 5060 é a mais rápida; se precisar de mais de 8 GB, a 3060 12 GB ou a 4060 Ti 16 GB permitem executar modelos que a 4060 não consegue carregar.
#Veredito 2026
- Mantenha sua 4060 se
- Você usa modelos de 3B a 9B, um chat ou um RAG leve. Nada justifica substituí-la enquanto a memória for suficiente.
- Não compre uma 4060 para rodar LLMs
- Se o LLM for o uso principal, uma placa de 12 GB ou mais é mais útil, mesmo que isso implique priorizar uma placa usada.
- Mude para 16 GB
- Se você busca modelos de 14B a 24B, 8 GB nunca serão suficientes.
- Fonte: especificações oficiais NVIDIA (RTX 4060 e 4060 Ti)
- Fonte: FAQ oficial do Ollama (contexto, Flash Attention, cache K/V)
- Fonte: tamanhos dos modelos Qwen 3.5 na biblioteca Ollama
#Perguntas frequentes
A RTX 4060 consegue rodar um LLM localmente?+
Quantos tokens por segundo em uma RTX 4060?+
RTX 4060 ou RTX 3060 12 GB para um LLM?+
Qual fonte de alimentação é necessária para uma RTX 4060?+
Como saber se o meu modelo cabe na VRAM?+
É possível aproveitar melhor os 8 GB sem trocar de placa?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.