Iniciante 11 minRTX 40

Qual LLM na RTX 4060 (8 GB) ?

Resposta direta

Uma RTX 4060 (8 GB de GDDR6, 272 GB/s) executa sem problemas modelos de 3 a 9 bilhões de parâmetros em Q4: Qwen 3.5 4B (3,4 GB), Granite 4.2 8B (5,3 GB) ou Qwen 3.5 9B (6,6 GB). Ela fica lenta quando um modelo e seu contexto ultrapassam 8 GB. Sua largura de banda impõe um limite teórico de cerca de 50 tokens/s em um 8B em Q4. Acima disso, são os 12 ou 16 GB que mudam o uso, não a velocidade do GPU.

A RTX 4060 é a placa de entrada da geração Ada: 8 GB de VRAM, 115 W e preço baixo no mercado de usados. Ela é suficiente para experimentar LLMs locais, desde que você conheça seu limite exato. Este guia quantifica o que cabe em seus 8 GB, o que sua largura de banda permite, como ajustar o Ollama para não exceder essa capacidade e quando vale mais a pena passar para uma placa de 12 ou 16 GB.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux
Hardware recomendado

Opção de compra para este guia: RTX 5060 Ti 16 GB.

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#A RTX 4060 para um LLM local: o que ela permite

Em uma RTX 4060, um LLM local funciona bem desde que o modelo, seu contexto e o sistema caibam em 8 GB de VRAM. Em Q4, isso abrange modelos com 3 a 9 bilhões de parâmetros: Qwen 3.5 4B pesa 3,4 GB, Granite 4.2 8B 5,3 GB e Qwen 3.5 9B 6,6 GB de acordo com a biblioteca Ollama. Um modelo de 12B como Gemma 4 12B (7,7 a 8 GB) já ocupa toda a placa antes mesmo de contar o contexto. A largura de banda de 272 GB/s determina a velocidade: ela estabelece um limite teórico de cerca de 51 tokens/s em um modelo de 5,3 GB, e a velocidade real fica abaixo desse limite. Para um assistente de chat, resumo ou um pequeno RAG, isso é suficiente. Para trabalhar com código em um grande repositório ou realizar raciocínios longos, é insuficiente.

Arquitetura
Ada Lovelace, 3.072 núcleos CUDA, Tensor Cores da 4ª geração, capacidade de cálculo CUDA 8.9.
Memória
8 GB de GDDR6 em um barramento de 128 bits, ou seja, 272 GB/s de largura de banda (fonte: Wikipedia, tabela da série GeForce 40).
Consumo
115 W de potência gráfica total; a NVIDIA indica uma fonte de alimentação de no mínimo 550 W para o computador inteiro.
Interface
PCIe 4.0 limitado a 8 pistas: um modelo que não cabe na VRAM e passa a usar a RAM trafega por uma conexão estreita, o que penaliza ainda mais o offload.
Disponibilidade
Lançada em 2023, a placa é encontrada principalmente no mercado de usados; os preços são acompanhados na página dedicada.
!
Por que a largura de banda importa mais que os núcleos
Durante a geração, cada token exige que a GPU releia a maior parte dos pesos do modelo. A velocidade depende, portanto, da relação entre a largura de banda da memória e o tamanho dos pesos, muito mais do que do número de núcleos. Nesse ponto, a 4060 é a mais limitada da linha Ada para o público em geral: 272 GB/s, contra 672 GB/s para uma 4070 Ti Super.

#Quais modelos cabem em 8 GB

A referência do site em Q4 é simples: cerca de 0,6 GB por bilhão de parâmetros, considerando apenas os pesos. É preciso acrescentar o cache de contexto (KV cache) e uma margem para a exibição e o sistema. O Ollama usa por padrão um contexto de 4.096 tokens, que ainda ocupa pouca memória; com 16.000 tokens, o cache passa a representar uma parcela importante do uso de memória. A tabela abaixo reúne os tamanhos publicados pelo Ollama e indica a margem restante em 8 GB, antes de considerar o contexto.

Modelos comuns em 8 GB de VRAM (tamanhos Ollama, apenas pesos)
ModeloTamanho do OllamaMargem com 8 GBVeredito
Qwen 3.5 4B3,4 GB4,6 GBConfortável, contexto longo possível
Granite 4.2 8B5,3 GB2,7 GBConfortável até cerca de 16.000 tokens com cache quantizado
Qwen 3.5 9B6,6 GB1,4 GBApertado: contexto curto, aplicativos fechados
Gemma 4 12B7,7 a 8,0 GB0 GB ou menosNão cabe na memória com um contexto útil
gpt-oss 20B14 GBNegativoNão cabe apenas na VRAM
Mistral Small 24B14 GBNegativoNão cabe apenas na VRAM

Duas armadilhas aparecem com frequência. A primeira: o tamanho do arquivo não corresponde à memória necessária, pois o contexto exige memória adicional. A segunda: um modelo que excede a capacidade da VRAM não trava; ele é carregado parcialmente na RAM do sistema e fica muito mais lento. O comando ollama ps exibe a distribuição: uma linha com 100 % na GPU indica uma situação normal; uma linha dividida entre CPU/GPU indica que parte do modelo foi carregada fora da VRAM.

#Instalar Ollama e iniciar um primeiro modelo

  1. 01
    Verificar o driver NVIDIA
    Ollama exige um driver NVIDIA 550 ou mais recente para placas com capacidade de computação 5.0 ou superior. Uma RTX 4060 (capacidade 8.9) é explicitamente listada na documentação do Ollama. Verifique a versão com nvidia-smi.
  2. 02
    Instalar Ollama
    Siga o guia de instalação para seu sistema. O CUDA está embutido, nenhuma instalação separada do toolkit é necessária.
  3. 03
    Iniciar um modelo adequado
    Comece com ollama run granite4.2:8b (5,3 GB) ou ollama run qwen3.5:9b (6,6 GB). Em seguida, execute o comando ollama ps em um segundo terminal.
  4. 04
    Verificar o posicionamento
    A coluna PROCESSOR deve mostrar 100 % GPU. Caso contrário, reduza o contexto ou mude para um modelo menor.

#Qual velocidade esperar: o limite, não a promessa

Não há aqui medições próprias, e nenhum número de desempenho é apresentado como resultado de uma medição própria. No entanto, é possível calcular um teto: a largura de banda dividida pelo tamanho dos pesos lidos a cada token. Um levantamento de terceiros publicado no GitHub (LLaMA 3 8B em Q4_K_M com llama.cpp, retrato de maio de 2024) apresenta razões entre o desempenho observado e o teto de 68% em uma RTX 4080 e de 75% em uma RTX 4070 Ti. Ordem de grandeza razoável: 70% do teto. Esses valores continuam sendo estimativas, válidas para um contexto curto.

Limite teórico de geração na RTX 4060 (272 GB/s)
Modelo (Q4)Tamanho do modeloLimite teóricaEstimativa em 70 %
Qwen 3.5 4B3,4 GB80 tokens/scerca de 56 tokens/s
Granite 4.2 8B5,3 GB51 tokens/saproximadamente 36 tokens/s
Qwen 3.5 9B6,6 GB41 tokens/scerca de 29 tokens/s

Essas estimativas são coerentes com o uso de um assistente de chat: a leitura é confortável a partir de 15 a 20 tokens/s. Elas não levam em conta o contexto, que torna a geração mais lenta à medida que cresce, nem o tempo de processamento do prompt, que pesa no processamento computacional e não na memória.

#Ajustar o Ollama para não ultrapassar os 8 GB

Os ajustes que importam são os do contexto e do cache. O Ollama quantiza o cache K/V em q8_0 para usar aproximadamente metade da memória do f16, com uma perda de precisão muito baixa de acordo com sua documentação; isso exige Flash Attention. Com 8 GB, é o ajuste que mais compensa: permite aumentar o contexto sem mudar de modelo.

Configurações do servidor Ollama (Linux, macOS)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_CONTEXT_LENGTH=8192
ollama serve
Contexto razoável
Aumente o contexto para 8.192 ou 16.384 tokens somente se o uso exigir: cada duplicação do contexto duplica o cache K/V.
Apenas um modelo carregado
Em 8 GB, mantenha apenas um modelo na memória; um modelo de embeddings para um RAG deve ser pequeno.
Liberar a VRAM
O ambiente de trabalho, o navegador e os jogos reservam VRAM. Feche-os antes de carregar um modelo e verifique com nvidia-smi.
Quantização
Continue usando Q4_K_M: um modelo de 8B em Q8 (cerca de 8,5 GB) excede a capacidade de memória da placa.

#O que a 4060 faz bem, mal ou não faz

O veredito depende mais do uso do que da placa. Uma conversa curta ou um resumo de algumas páginas fica dentro da zona de conforto, tanto em um modelo de 4B quanto em um de 8B. Um RAG exige um modelo de geração, um modelo de embeddings e um contexto longo o suficiente para conter os trechos recuperados: com 8 GB, é preciso escolher um modelo de geração de 4B a 8B e manter o modelo de embeddings pequeno. O assistente de código é mais exigente, pois os modelos especializados e seus contextos de vários milhares de tokens rapidamente excedem a capacidade da placa.

Usos comuns na RTX 4060 (8 GB)
UsoRealista?Ajuste recomendado
Chat diário, perguntas curtasSimGranite 4.2 8B ou Qwen 3.5 4B, contexto padrão
Resumo de documentos de 10 a 20 páginasSim, com um contexto de 8.192 a 16.384Cache K/V em q8_0, Flash Attention ativada
RAG em seus arquivosSim, modelo 4B a 8BEmbeddings leves, apenas um modelo de geração carregado
Assistente de código em um repositórioLimitadoModelo de 4B a 8B, trechos curtos, sem incluir o repositório inteiro
Modelo de 20B ou mais, incluindo gpt-oss 20BNãoPrever no mínimo 16 GB de VRAM

O caso de gpt-oss 20B ilustra esse limite: o Ollama indica 14 GB para esse modelo, e sua ficha informa que a quantização MXFP4 permite executá-lo a partir de 16 GB de memória. Uma placa de 8 GB não se enquadra nessa configuração, independentemente de sua velocidade de processamento.

#Quando passar para outra placa

Três sinais indicam que os 8 GB se tornam um obstáculo. Você quer um modelo de 12B ou mais, incluindo Gemma 4 12B. Você trabalha com documentos longos, onde o contexto excede 16 000 tokens. Você usa um assistente de código que carrega um modelo de 14 a 24 GB. Nesses casos, adicionar velocidade não resolve nada: falta capacidade de memória, e a página dedicada aos 8 GB, aos 12 GB e aos 16 GB ajuda você a escolher o nível certo.

#4060, 3060 12 GB, 5060: o equilíbrio certo

Placas de entrada: capacidade e largura de banda
PlacaVRAMLargura de bandaO que isso muda
RTX 3060 12 GB12 GB360 GB/sMais VRAM: Gemma 4 12B cabe, mas o barramento é mais antigo
RTX 40608 GB272 GB/sConsumo baixo, limite de 8B-9B
RTX 50608 GB448 GB/sMesma capacidade, limite de velocidade 65 % superior

A RTX 3060 12 GB oferece 4 GB de memória a mais e uma largura de banda maior (360 GB/s segundo a Wikipedia). No mercado de usados, ela geralmente custa menos: consulte /prix-gpu-ia para conferir a situação do mercado. A RTX 5060 mantém 8 GB, mas lê a memória 65 % mais rápido. Se o seu uso couber em 8 GB, a 5060 é a mais rápida; se precisar de mais de 8 GB, a 3060 12 GB ou a 4060 Ti 16 GB permitem executar modelos que a 4060 não consegue carregar.

#Veredito 2026

Mantenha sua 4060 se
Você usa modelos de 3B a 9B, um chat ou um RAG leve. Nada justifica substituí-la enquanto a memória for suficiente.
Não compre uma 4060 para rodar LLMs
Se o LLM for o uso principal, uma placa de 12 GB ou mais é mais útil, mesmo que isso implique priorizar uma placa usada.
Mude para 16 GB
Se você busca modelos de 14B a 24B, 8 GB nunca serão suficientes.

#Perguntas frequentes

FAQ
A RTX 4060 consegue rodar um LLM localmente?+
Sim, até cerca de 9 bilhões de parâmetros em Q4. Granite 4.2 8B (5,3 GB) e Qwen 3.5 9B (6,6 GB) cabem na VRAM, com um contexto curto para o segundo. Acima de 8 GB, o Ollama passa a usar a RAM do sistema, e a geração fica muito mais lenta, tornando os modelos de 12B ou mais pouco práticos.
Quantos tokens por segundo em uma RTX 4060?+
Nenhuma medida confiável é publicada aqui. O limite teórico, banda passante dividida pelo peso, é de cerca de 51 tokens/s para um modelo de 5,3 GB, ou seja, cerca de 36 tokens/s a 70% desse limite. Trata-se de uma estimativa, não de um resultado medido, e diminui quando o contexto se alonga.
RTX 4060 ou RTX 3060 12 GB para um LLM?+
Para o LLM, a 3060 de 12 GB geralmente é mais interessante: 4 GB a mais de memória e uma largura de banda de 360 GB/s contra 272 GB/s. Ela carrega o modelo Gemma 4 12B, que a 4060 não consegue acomodar. A 4060 mantém a vantagem no consumo, de 115 W, e em jogos.
Qual fonte de alimentação é necessária para uma RTX 4060?+
A NVIDIA indica 115 W de potência gráfica total e uma fonte de alimentação de no mínimo 550 W recomendada para o PC inteiro. Esse valor inclui uma margem para o processador e os picos de consumo. Uma fonte de qualidade dessa potência é suficiente, já que o LLM exige menos da placa do que alguns jogos.
Como saber se o meu modelo cabe na VRAM?+
Inicie o modelo e depois execute ollama ps em um segundo terminal: a coluna PROCESSOR exibe 100 % GPU se tudo estiver na VRAM, ou uma divisão entre CPU e GPU se parte do modelo precisar ficar na RAM do sistema. Monitore também nvidia-smi durante uma geração longa. Se houver essa transferência para a RAM do sistema, reduza o contexto ou escolha um modelo menor.
É possível aproveitar melhor os 8 GB sem trocar de placa?+
Três medidas ajudam: ativar o Flash Attention e depois o cache K/V em q8_0, que reduz esse cache aproximadamente pela metade; limitar o contexto ao que você usa; fechar os aplicativos que ocupam VRAM. Essas medidas permitem ampliar o contexto, mas não carregar um modelo maior.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.