Qwen 3 localmente: teste completo e benchmarks reais
O Qwen 3 se tornou a referência open-weight para muita gente que executa um LLM localmente. Mas entre as versões densas (8B, 14B, 32B) e a versão MoE 30B-A3B, é fácil se perder. Este benchmark do Qwen3 Ollama testa três variantes em três máquinas muito diferentes — RTX 4090, RTX 3060 12 GB, MacBook Pro M4 Pro — para apresentar números reais e um veredito direto.
#A linha Qwen 3: modelos densos vs MoE
A Alibaba publicou o Qwen 3 em duas famílias distintas. Os modelos densos (Qwen3-1.7B, 4B, 8B, 14B, 32B) seguem a arquitetura clássica: todos os parâmetros são usados a cada token. A família MoE (Qwen3-30B-A3B, Qwen3-235B-A22B) ativa apenas uma fração dos especialistas por token — daí o sufixo A3B = 3 bilhões de parâmetros ativos de um total de 30.
Na prática, para o usuário local, isso muda duas coisas: a VRAM necessária corresponde aos parâmetros totais (o modelo inteiro deve caber na memória), mas a velocidade corresponde aos parâmetros ativos. Um MoE 30B-A3B cabe em 19 GB em Q4, como um modelo denso de 32B, mas gera seus tokens à velocidade de um 3B. É isso que o torna tão interessante.
#Configuração e hardware testado
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
Três máquinas cobrem praticamente todo o espectro da execução local em 2026:
- RTX 4090 24 GB
- Computador de mesa em formato torre com Windows 11, Ryzen 9 7950X e 64 GB DDR5. Uma configuração topo de linha para o mercado consumidor.
- RTX 3060 12 GB
- Computador de torre com Linux Ubuntu 24.04, Ryzen 5 5600X e 32 GB de DDR4. A configuração econômica mais popular.
- MacBook Pro M4 Pro 48 GB
- macOS 15, GPU com 16 núcleos, memória unificada. Representativo dos laptops de ponta da Apple.
Backend idêntico em todos os lugares: Ollama (daemon em localhost:11434). Todos os modelos em Q4_K_M por padrão, contexto de 8192 tokens, prompt padronizado de aproximadamente 500 tokens. Velocidade medida em 10 gerações de 500 tokens em média.
#Qwen3-8B: o modelo denso de entrada
Modelo denso com 8 bilhões de parâmetros, ~5 GB em Q4_K_M. Feito para rodar em qualquer lugar: 8 GB de VRAM são mais do que suficientes. É o candidato natural para quem está conhecendo o Qwen 3 em uma RTX 3060 ou em um laptop.
- RTX 4090
- ~95 tokens/sec. A placa é muito pouco aproveitada — toda a VRAM disponível é subutilizada nesse nível.
- RTX 3060 12 GB
- ~52 tokens/seg. Muito confortável, bem acima do limiar de fluidez (20 t/s).
- M4 Pro 48 GB
- ~38 tokens/seg. Inferior às RTX, mas amplamente utilizável e sem ruído do ventilador.
No que diz respeito à qualidade, o Qwen3-8B faz um ótimo trabalho em tarefas comuns: resumo, reformulação, código simples, perguntas e respostas. Ele é claramente superado quando se passa a raciocínio em múltiplas etapas ou código não trivial — é aí que você percebe que está lidando com um 8B. O francês é correto, mas não excelente; observam-se alguns anglicismos e construções estranhas.
#Qwen3-14B: o ponto ideal entre os modelos densos
Denso de 14B, aproximadamente 9 GB em Q4_K_M. Cabe sem problemas em 12 GB de VRAM com um contexto razoável. É o modelo que recomendamos para 90 % das pessoas que possuem uma RTX 3060 de 12 GB, 4070 ou equivalente.
- RTX 4090
- ~78 tokens/s. Velocidade excelente, ainda estamos longe do limite da GPU.
- RTX 3060 12 GB
- ~32 tokens/s. Confortável para uso em chat; o contexto de 8k cabe sem offload.
- M4 Pro 48 GB
- ~24 tokens/s. No limite do confortável, mas utilizável no dia a dia.
O salto de qualidade em relação ao 8B é claro. Código Python correto em funções de 50 a 80 linhas, raciocínio mais sólido, francês realmente melhor (expressões naturais, poucos erros de gênero). É o primeiro modelo da linha que realmente se assemelha a um assistente de IA na nuvem de entrada em termos de coerência.
#Qwen3-30B-A3B: o MoE que muda tudo
É aqui que isso se torna interessante. O 30B-A3B pesa aproximadamente 19 GB em Q4_K_M (= são necessários 24 GB de VRAM para rodá-lo confortavelmente com contexto), mas gera usando apenas 3B de parâmetros ativos. Resultado: qualidade de um 30B, velocidade de um 3B.
- RTX 4090
- ~110 tokens/s. Sim, mais rápido que o 8B denso. Essa é a magia do MoE: menos computação por token.
- RTX 3060 12 GB
- Não cabe na VRAM. Offload parcial para a CPU ≈ 8 t/s — utilizável para testes, mas frustrante.
- M4 Pro 48 GB
- ~45 tokens/s. A memória unificada se destaca aqui: tudo cabe na RAM, e o MoE compensa os FLOPS limitados.
A qualidade é muito próxima à de um Qwen 32B denso. O 30B-A3B se destaca especialmente em código (no mesmo nível de um Qwen3-Coder 30B-A3B em tarefas intermediárias de Python) e em raciocínio estruturado. No francês escrito, ele é realmente bom — no nível de um Mistral Small 24B, para dar uma referência.
#Thinking mode: útil ou não?
Qwen 3 introduz um modo de pensamento que pode ser ativado ou desativado. Quando ativado, o modelo gera primeiro um bloco <think>...</think> com seu raciocínio antes de produzir a resposta final. Isso é inspirado no DeepSeek R1, mas é mais modular: é possível ativar ou desativar esse modo durante o uso.
O que observamos em 50 prompts testados:
- Tarefas simples (chat, reformulação)
- Modo de raciocínio = perda de tempo. Adiciona de 2 a 5 segundos de latência sem nenhum ganho de qualidade. Desative-o.
- Matemática, lógica, raciocínio em múltiplas etapas
- Ganho líquido de precisão: +20 a +30% de respostas corretas em problemas do tipo GSM8K. Mantenha ativado.
- Código complexo (refatoração, depuração)
- Ganho moderado (+10 %) em qualidade, mas latência dobrada. Testar conforme sua paciência.
- Geração criativa (texto longo, diálogo)
- Frequentemente contraproducente: o modelo pensa demais e perde a espontaneidade.
#Qualidade em francês vs Llama 4
Comparamos as respostas em francês do Qwen3-14B e do Qwen3-30B-A3B com as do Llama 4 Scout (o modelo equivalente da Meta, lançado na mesma época) em três exercícios: redação de um e-mail profissional, explicação acessível de um conceito técnico e análise de um texto literário curto.
- Qwen3-14B
- Francês correto, expressões naturais, mas alguns erros de gênero persistem (« la problème »). Vocabulário um pouco sem expressividade.
- Qwen3-30B-A3B
- Francês escrito muito bom. Sem erros estruturais, vocabulário variado, registro adequado ao contexto. Ligeiramente inferior ao Mistral Small 24B nas nuances muito idiomáticas.
- Llama 4 Scout
- Francês impecável do ponto de vista gramatical, mas com um tom mais “traduzido do inglês” que o do Qwen. Preferências pessoais.
Veredito pragmático: para francês profissional, Qwen3-30B-A3B e Llama 4 Scout estão praticamente empatados. A escolha depende de outros critérios (velocidade, tamanho, licença). Para francês literário ou muito idiomático, Mistral Small continua um nível acima.
#Qual Qwen 3 escolher de acordo com a sua configuração?
- 6-8 GB de VRAM (RTX 3050, 3060 Ti, 4060)
- Qwen3-8B em Q4_K_M. O 14B cabe em Q3, mas a qualidade se degrada — fique com o 8B sem essa perda de qualidade.
- 12 GB de VRAM (RTX 3060 12, 4070, 5070)
- Qwen3-14B em Q4_K_M é o ponto ideal incontestável. Contexto de 16k confortável.
- 16 GB (RTX 4080, 5070 Ti, 5080)
- Qwen3-14B em Q5 ou Q6 para maior conforto, ou um 30B-A3B em Q3_K_M se você quiser testar o MoE.
- 24 GB (RTX 3090, 4090, RX 7900 XTX)
- Qwen3-30B-A3B em Q4_K_M. Não há discussão: é o melhor modelo local de uso geral disponível hoje.
- Mac com chip da série M e 32–48 GB de memória unificada
- Qwen3-30B-A3B em Q4 ou Q5. O MoE se sai especialmente bem com a memória unificada da Apple.
- Mac Studio Ultra 128 GB+
- Vá direto para o Qwen3-235B-A22B (~120 GB em Q4) se quiser o topo da linha. Caso contrário, o 30B-A3B em Q8 continua excelente.
#Para se aprofundar
Se o Qwen 3 for seu ponto de partida, saiba que a geração seguinte já tomou seu lugar nos nossos rankings — o Qwen 3.5 9B tornou-se a escolha padrão para configurações de 8 GB (256k de contexto, visão), e o Qwen 3.8 27B, para as de 24 GB; os ajustes abaixo continuam válidos sem alterações nesses modelos. Algumas sugestões para ir além:
- Escolher sua quantização
- Para entender exatamente o que você perde entre Q4_K_M e Q5_K_M no Qwen 3 e quando faz sentido usar uma quantização de maior precisão.
- Personalizar com um Modelfile
- Para definir o modo de pensamento, o contexto e um prompt de sistema padrão em francês na sua instância do Qwen 3 — em vez de refazer os ajustes a cada sessão.
- Open WebUI com Ollama
- Para passar do terminal a uma verdadeira interface de chat com histórico, markdown e anexos, sem abrir mão do uso local.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.