Qual LLM para RTX 3050 (6 / 8 GB) ?
Uma RTX 3050 roda com facilidade modelos pequenos de 3 a 4 bilhões de parâmetros em Q4, como Granite 4.1 3B (2 GB) ou Qwen 3.5 4B (2,3 GB). Um 8B em Q4 (Granite 4.2 8B, 4,6 GB) cabe na versão de 8 GB e fica no limite na de 6 GB. A tabela pública do llama.cpp indica 37 tokens/s para a versão de 6 GB com um 7B em Q4_0.
A RTX 3050 existe em duas versões para desktop muito diferentes: a de 8 GB de 2022 e a de 6 GB de 2024, que tem menos núcleos, um barramento mais estreito e consumo de 70 W. Este guia separa o que é medido do que é estimado, indica quais modelos cabem em cada versão e explica como tirar o máximo de uma placa de 6 GB.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Opção de compra para este guia: RTX 5060 Ti 16 GB.
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#A RTX 3050 em 2026: o que ela executa
Uma RTX 3050 executa com folga modelos de 3 a 4 bilhões de parâmetros em quantização Q4. De acordo com o catálogo QuelLLM, o Granite 4.1 3B pesa 2 GB e o Qwen 3.5 4B, 2,3 GB: eles cabem tanto na versão de 6 GB quanto na de 8 GB, com espaço para o contexto. Um modelo de 8 bilhões, como o Granite 4.2 8B (4,6 GB em Q4), cabe na versão de 8 GB e fica no limite na de 6 GB, que disponibiliza apenas 5 804 MiB para o llama.cpp. Um 9B como o Qwen 3.5 9B (6 GB de pesos) não cabe em nenhuma das duas sem transferir parte do modelo para a RAM. Quanto à velocidade, o único resultado público é o de uma placa de 6 GB: 37 tokens por segundo em um modelo de 7 bilhões em Q4_0. É um resultado razoável para conversar, mas a placa chega ao limite assim que o modelo aumenta de tamanho.
#RTX 3050 de 6 GB ou 8 GB: duas placas diferentes
Sob o mesmo nome, a NVIDIA vendeu dois produtos. As medições não podem ser misturadas: a versão de 6 GB é mais lenta com a mesma quantidade de memória, porque seu barramento de 96 bits limita a largura de banda a 168 GB/s, contra 224 GB/s para a versão de 8 GB.
| Critério | RTX 3050 8 GB | RTX 3050 6 GB |
|---|---|---|
| Núcleos CUDA | 2 560 | 2 304 |
| Barramento de memória / largura de banda | 128 bits / 224 GB/s | 96 bits / 168 GB/s |
| Potência da placa | 130 W | 70 W |
| Fonte de alimentação do sistema recomendada pela NVIDIA | 550 W | 300 W |
| Geração com Llama 2 7B Q4_0 | Não publicada (estimada entre 45 e 50 tok/s) | 37,4 tok/s (medida publicada) |
O valor estimado para a versão de 8 GB é calculado aplicando aos 224 GB/s a relação entre a medição e o limite teórico da versão de 6 GB, que atinge cerca de 85% do desempenho permitido por sua largura de banda. Trata-se de uma projeção, que não deve ser citada como resultado. Seu consumo de 70 W torna a versão de 6 GB interessante para um PC antigo cuja fonte de alimentação é limitada; a ficha da NVIDIA, aliás, não lista nenhum conector de alimentação adicional para essa versão.
#Modelos compatíveis de acordo com a memória
| Modelo | Pesos em Q4 | RTX 3050 6 GB | RTX 3050 8 GB |
|---|---|---|---|
| Granite 4.1 3B | 2 GB | Com muita folga | Com muita folga |
| Qwen 3.5 4B | 2,3 GB (Q8: 4,3 GB) | Com folga em Q4, no limite em Q8 | Com folga, Q8 possível |
| Granite 4.2 8B | 4,6 GB | Limite: contexto muito curto | Razoável, contexto moderado |
| Qwen 3.5 9B | 6 GB | Não cabe | No limite, com contexto curto |
A regra a lembrar é deixar pelo menos um gigabyte livre para o contexto e o sistema. Na placa de 6 GB, a memória realmente disponível para o llama.cpp é de 5.804 MiB, ou seja, um pouco menos de 5,7 GB: um modelo de 4,6 GB pode caber, mas o contexto deverá permanecer curto. Na placa de 8 GB, o mesmo modelo deixa quase três gigabytes de margem. O guia sobre 6 GB de VRAM detalha os modelos que funcionam com folga nessa capacidade.
#Velocidade: medições e estimativas
O quadro colaborativo do llama.cpp recebeu em julho de 2026 uma medição em uma RTX 3050 de 6 GB: 37,39 tokens por segundo em geração no Llama 2 7B em Q4_0, um arquivo de 3,56 GiB. Com Flash Attention, o valor passa para 38,51. Esse resultado merece duas leituras. Primeiro, atinge aproximadamente 85 % do que a banda passante de 168 GB/s permite, o que é um bom desempenho: a placa está limitada pela memória, não pelos núcleos. Em seguida, a taxa diminui quando a geração se alonga: cai para 33,52 tokens por segundo em 2 048 tokens, ou seja, cerca de 10 % a menos.
Pode-se extrapolar para outros modelos por regra de três com base no tamanho do arquivo. São limites teóricos superiores, calculados a partir da medição feita na placa de 6 GB, e não resultados publicados.
| Modelo | Pesos em Q4 | Taxa estimada |
|---|---|---|
| Granite 4.1 3B | 2 GB | aproximadamente 70 tokens/s |
| Qwen 3.5 4B | 2,3 GB | cerca de 60 tokens/s |
| Granite 4.2 8B | 4,6 GB | aproximadamente 30 tokens/s |
Como comparação, a RTX 3060 de 12 GB gera 75,6 tokens por segundo no mesmo teste: o dobro da 3050 de 6 GB. Em um modelo de 8 bilhões, a diferença é clara, pois a 3050 de 6 GB atinge cerca de 30 tokens por segundo na estimativa teórica, o que é legível, mas mais lento do que a leitura.
#Dicas para aproveitar 6 GB
- 01Escolher um modelo de 4 bilhões ou menosQwen 3.5 4B ou Granite 4.1 3B em Q4 deixam 3 a 4 GB de margem, o que permite um contexto confortável e um throughput significativamente superior.
- 02Liberar a memória de vídeoFeche o navegador, os jogos e tudo que use a placa: com 6 GB, cada gigabyte ocupado por outro aplicativo reduz a memória disponível para o contexto.
- 03Quantizar o cache K/VA documentação do Ollama especifica que o cache K/V pode ser quantizado quando o Flash Attention está ativado. Defina OLLAMA_FLASH_ATTENTION=1 e depois OLLAMA_KV_CACHE_TYPE=q8_0 antes de iniciar o servidor.
- 04Verificar o carregamentoApós o primeiro prompt, execute ollama ps: a coluna Processor deve mostrar 100% GPU. Caso contrário, o modelo excede a capacidade da memória da GPU e a velocidade cai drasticamente.
#Identificar a versão que você possui
As duas placas têm o mesmo nome, e os anúncios de segunda mão nem sempre especificam a memória. Vários indícios permitem decidir sem abrir o PC. A ficha NVIDIA distingue a potência da placa: 130 W para a versão de 8 GB, 70 W para a de 6 GB, com uma fonte de alimentação do sistema recomendada de 550 W contra 300 W. Uma placa sem conector de alimentação externa é, portanto, muito provavelmente uma de 6 GB, mesmo que alguns modelos de fabricantes possam adicionar um. Uma vez a placa instalada, o comando nvidia-smi exibe a memória total: um valor próximo de 6 000 MiB indica a versão pequena, e um valor próximo de 8 000 MiB a grande. O teste llama.cpp da de 6 GB, aliás, registrou 5 804 MiB utilizáveis, um pouco menos que a capacidade nominal.
Essa verificação evita uma confusão cara: pagar por uma placa de 8 GB e receber uma de 6 GB muda o que você consegue rodar, pois o Granite 4.2 8B fica apenas minimamente viável nela. Peça sempre uma captura de tela do nvidia-smi antes de comprar e recuse anúncios que não especifiquem a memória. Faça o mesmo para uma placa já instalada em um PC reaproveitado: o nome exibido pelo Windows não é suficiente para distinguir as duas versões.
#O contexto: até onde avançar com 6 GB
A tabela do llama.cpp mostra que o throughput da 3050 de 6 GB cai 10% entre 128 e 2.048 tokens gerados. A memória é o segundo efeito: o cache de contexto consome VRAM proporcionalmente ao comprimento da conversa. Em uma placa de 6 GB com um modelo de 4 bilhões em Q4 (2,3 GB), sobram mais de 3 GB para o cache, o que permite contextos de vários milhares de tokens sem esforço. Com um 8B de 4,6 GB, sobra apenas cerca de um gigabyte: o contexto se torna o fator limitante muito antes de a velocidade se tornar uma limitação.
Dois hábitos evitam surpresas desagradáveis. Primeiro, limite deliberadamente a janela de contexto ao que você precisa, em vez de deixar um modelo que anuncia centenas de milhares de tokens de contexto reservar uma parte desnecessária dessa capacidade. Em seguida, se você trabalhar com documentos longos, divida-os: resumir três textos de dois mil tokens consome menos memória do que resumir um único texto de seis mil. O guia sobre a janela de contexto detalha essas escolhas e seus efeitos.
#Para que serve realmente uma RTX 3050 para IA local
Com um modelo de 3 a 4 bilhões de parâmetros em Q4, ela é suficiente para tarefas específicas: resumir um texto, reformular, classificar mensagens, responder a perguntas simples sobre um documento curto ou fazer autocompletar código. Ela não é muito adequada para conversas longas com um modelo de 8B, RAG com documentos volumosos ou tarefas de raciocínio que exigem os modelos mais capazes. A limitação não é apenas a velocidade: os modelos pequenos cometem mais erros e perdem o fio da conversa mais rápido. Portanto, planeje verificar as respostas deles sobre assuntos importantes e não lhes delegue decisões de grande responsabilidade sem revisão humana.
Se você busca, acima de tudo, conhecer a IA local gastando pouco, a placa cumpre esse papel. Se você quer um assistente para o dia a dia, um modelo de 8B com 8 GB de memória é o mínimo, e 12 GB oferecem uma margem que os preços de equipamentos usados muitas vezes tornam acessível.
#Veredito 2026
- Uso limitado a pequenos modelos
- Com 6 GB, limite-se a modelos de 4 bilhões de parâmetros ou menos. Com 8 GB, um modelo de 8B em Q4 funciona com um contexto moderado.
- Prefira uma placa de 12 GB
- A 3060 de 12 GB dobra a taxa de geração medida e permite rodar modelos de 12 bilhões de parâmetros. A diferença de preço no mercado de usados varia a cada semana: consulte o acompanhamento.
- Na hora da compra
- Só opte pela 3050 se ela já estiver no seu PC ou se o orçamento for muito apertado. Verifique a versão, 6 ou 8 GB: os anúncios nem sempre especificam isso.
#Perguntas frequentes
A RTX 3050 pode rodar um LLM?+
RTX 3050 de 6 GB ou 8 GB para IA local?+
Qual modelo escolher em uma RTX 3050 de 6 GB?+
Quantos tokens por segundo em uma RTX 3050?+
RTX 3050 ou RTX 3060 de 12 GB para um LLM?+
Ollama funciona com uma RTX 3050?+
- Fonte: tabela de desempenho do llama.cpp em CUDA
- Fonte: ficha da NVIDIA sobre a RTX 3050
- Fonte: placas NVIDIA suportadas pelo Ollama
- Fonte: FAQ do Ollama (ollama ps, cache K/V)
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.