Iniciante 12 minModelos

Qwen 3 localmente: teste completo e benchmarks reais

O Qwen 3 se tornou a referência open-weight para muita gente que executa um LLM localmente. Mas entre as versões densas (8B, 14B, 32B) e a versão MoE 30B-A3B, é fácil se perder. Este benchmark do Qwen3 Ollama testa três variantes em três máquinas muito diferentes — RTX 4090, RTX 3060 12 GB, MacBook Pro M4 Pro — para apresentar números reais e um veredito direto.

Por Mohamed Meguedmi·Atualização 2026-08-27·Testado no Windows, macOS e Linux
i
Em resumo
Qwen 3 existe em versões densas (8B, 14B, 32B) e em MoE (30B-A3B, 3B de parâmetros ativos em 30). · Em RTX 4090, espere aproximadamente 95 tok/s em 8B, 78 tok/s em 14B e 110 tok/s em 30B-A3B — o MoE é mais rápido que o 8B denso. · Em RTX 3060 12 GB, o 14B (aproximadamente 32 tok/s) continua sendo o melhor equilíbrio; o 30B-A3B não cabe na VRAM dessa placa. · No Mac M4 Pro, espere 38, 24 e 45 tok/s, respectivamente.

#A linha Qwen 3: modelos densos vs MoE

A Alibaba publicou o Qwen 3 em duas famílias distintas. Os modelos densos (Qwen3-1.7B, 4B, 8B, 14B, 32B) seguem a arquitetura clássica: todos os parâmetros são usados a cada token. A família MoE (Qwen3-30B-A3B, Qwen3-235B-A22B) ativa apenas uma fração dos especialistas por token — daí o sufixo A3B = 3 bilhões de parâmetros ativos de um total de 30.

Na prática, para o usuário local, isso muda duas coisas: a VRAM necessária corresponde aos parâmetros totais (o modelo inteiro deve caber na memória), mas a velocidade corresponde aos parâmetros ativos. Um MoE 30B-A3B cabe em 19 GB em Q4, como um modelo denso de 32B, mas gera seus tokens à velocidade de um 3B. É isso que o torna tão interessante.

i
As três variantes do teste
Focamos em Qwen3-8B (denso), Qwen3-14B (denso) e Qwen3-30B-A3B (MoE). São os três tamanhos que a maioria das configurações de 12 a 24 GB consegue rodar com conforto.

#Configuração e hardware testado

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Três máquinas cobrem praticamente todo o espectro da execução local em 2026:

RTX 4090 24 GB
Computador de mesa em formato torre com Windows 11, Ryzen 9 7950X e 64 GB DDR5. Uma configuração topo de linha para o mercado consumidor.
RTX 3060 12 GB
Computador de torre com Linux Ubuntu 24.04, Ryzen 5 5600X e 32 GB de DDR4. A configuração econômica mais popular.
MacBook Pro M4 Pro 48 GB
macOS 15, GPU com 16 núcleos, memória unificada. Representativo dos laptops de ponta da Apple.

Backend idêntico em todos os lugares: Ollama (daemon em localhost:11434). Todos os modelos em Q4_K_M por padrão, contexto de 8192 tokens, prompt padronizado de aproximadamente 500 tokens. Velocidade medida em 10 gerações de 500 tokens em média.

Baixar os três modelos
ollama pull qwen3:8b
ollama pull qwen3:14b
ollama pull qwen3:30b-a3b
→
Medir no seu ambiente
Para reproduzir este teste, adicione --verbose ao comando ollama run. O Ollama exibe eval rate (tokens/s de geração) e prompt eval rate (velocidade de prefill) no final de cada resposta.

#Qwen3-8B: o modelo denso de entrada

Modelo denso com 8 bilhões de parâmetros, ~5 GB em Q4_K_M. Feito para rodar em qualquer lugar: 8 GB de VRAM são mais do que suficientes. É o candidato natural para quem está conhecendo o Qwen 3 em uma RTX 3060 ou em um laptop.

RTX 4090
~95 tokens/sec. A placa é muito pouco aproveitada — toda a VRAM disponível é subutilizada nesse nível.
RTX 3060 12 GB
~52 tokens/seg. Muito confortável, bem acima do limiar de fluidez (20 t/s).
M4 Pro 48 GB
~38 tokens/seg. Inferior às RTX, mas amplamente utilizável e sem ruído do ventilador.

No que diz respeito à qualidade, o Qwen3-8B faz um ótimo trabalho em tarefas comuns: resumo, reformulação, código simples, perguntas e respostas. Ele é claramente superado quando se passa a raciocínio em múltiplas etapas ou código não trivial — é aí que você percebe que está lidando com um 8B. O francês é correto, mas não excelente; observam-se alguns anglicismos e construções estranhas.

#Qwen3-14B: o ponto ideal entre os modelos densos

Denso de 14B, aproximadamente 9 GB em Q4_K_M. Cabe sem problemas em 12 GB de VRAM com um contexto razoável. É o modelo que recomendamos para 90 % das pessoas que possuem uma RTX 3060 de 12 GB, 4070 ou equivalente.

RTX 4090
~78 tokens/s. Velocidade excelente, ainda estamos longe do limite da GPU.
RTX 3060 12 GB
~32 tokens/s. Confortável para uso em chat; o contexto de 8k cabe sem offload.
M4 Pro 48 GB
~24 tokens/s. No limite do confortável, mas utilizável no dia a dia.

O salto de qualidade em relação ao 8B é claro. Código Python correto em funções de 50 a 80 linhas, raciocínio mais sólido, francês realmente melhor (expressões naturais, poucos erros de gênero). É o primeiro modelo da linha que realmente se assemelha a um assistente de IA na nuvem de entrada em termos de coerência.

!
Contexto padrão do Ollama
O Ollama limita o contexto a 2048 tokens por padrão, o que é ridículo para o Qwen 3 (que suporta 32k nativamente). Force num_ctx por meio de um Modelfile ou de /set parameter num_ctx 8192 na sessão; caso contrário, você truncará conversas longas.

#Qwen3-30B-A3B: o MoE que muda tudo

É aqui que isso se torna interessante. O 30B-A3B pesa aproximadamente 19 GB em Q4_K_M (= são necessários 24 GB de VRAM para rodá-lo confortavelmente com contexto), mas gera usando apenas 3B de parâmetros ativos. Resultado: qualidade de um 30B, velocidade de um 3B.

RTX 4090
~110 tokens/s. Sim, mais rápido que o 8B denso. Essa é a magia do MoE: menos computação por token.
RTX 3060 12 GB
Não cabe na VRAM. Offload parcial para a CPU ≈ 8 t/s — utilizável para testes, mas frustrante.
M4 Pro 48 GB
~45 tokens/s. A memória unificada se destaca aqui: tudo cabe na RAM, e o MoE compensa os FLOPS limitados.

A qualidade é muito próxima à de um Qwen 32B denso. O 30B-A3B se destaca especialmente em código (no mesmo nível de um Qwen3-Coder 30B-A3B em tarefas intermediárias de Python) e em raciocínio estruturado. No francês escrito, ele é realmente bom — no nível de um Mistral Small 24B, para dar uma referência.

→
O veredito surpreendente
Se você tiver 24 GB de VRAM ou um Mac com 32 GB ou mais de memória unificada, Qwen3-30B-A3B continua sendo um excelente MoE de uso geral: melhor qualidade E maior velocidade que o 14B denso, sem comprometer nenhum desses aspectos. Desde este teste, a geração seguinte assumiu essa faixa — Qwen 3.8 27B (o modelo « próximo do Copilot » de 2026, 262k de contexto) e Qwen 3.6 35B-A3B, uma escolha confiável para configurações de 24 a 32 GB. O 30B-A3B medido aqui conserva todo esse DNA MoE.

#Thinking mode: útil ou não?

Qwen 3 introduz um modo de pensamento que pode ser ativado ou desativado. Quando ativado, o modelo gera primeiro um bloco <think>...</think> com seu raciocínio antes de produzir a resposta final. Isso é inspirado no DeepSeek R1, mas é mais modular: é possível ativar ou desativar esse modo durante o uso.

Ativar ou desativar o thinking
# Dans la session Ollama
/set parameter think true
/set parameter think false

# Ou via prompt direct (Qwen 3 reconnaît les balises)
>>> /think Combien fait 17 × 23 ?
>>> /no_think Salut, ça va ?

O que observamos em 50 prompts testados:

Tarefas simples (chat, reformulação)
Modo de raciocínio = perda de tempo. Adiciona de 2 a 5 segundos de latência sem nenhum ganho de qualidade. Desative-o.
Matemática, lógica, raciocínio em múltiplas etapas
Ganho líquido de precisão: +20 a +30% de respostas corretas em problemas do tipo GSM8K. Mantenha ativado.
Código complexo (refatoração, depuração)
Ganho moderado (+10 %) em qualidade, mas latência dobrada. Testar conforme sua paciência.
Geração criativa (texto longo, diálogo)
Frequentemente contraproducente: o modelo pensa demais e perde a espontaneidade.
i
Custo em tokens
Um bloco <think> típico adiciona entre 500 e 2.000 tokens antes da resposta. Em um 30B-A3B a 100 t/s isso é imperceptível. Em um 14B a 30 t/s, isso adiciona entre 10 e 60 segundos de latência — avalie suas prioridades.

#Qualidade em francês vs Llama 4

Comparamos as respostas em francês do Qwen3-14B e do Qwen3-30B-A3B com as do Llama 4 Scout (o modelo equivalente da Meta, lançado na mesma época) em três exercícios: redação de um e-mail profissional, explicação acessível de um conceito técnico e análise de um texto literário curto.

Qwen3-14B
Francês correto, expressões naturais, mas alguns erros de gênero persistem (« la problème »). Vocabulário um pouco sem expressividade.
Qwen3-30B-A3B
Francês escrito muito bom. Sem erros estruturais, vocabulário variado, registro adequado ao contexto. Ligeiramente inferior ao Mistral Small 24B nas nuances muito idiomáticas.
Llama 4 Scout
Francês impecável do ponto de vista gramatical, mas com um tom mais “traduzido do inglês” que o do Qwen. Preferências pessoais.

Veredito pragmático: para francês profissional, Qwen3-30B-A3B e Llama 4 Scout estão praticamente empatados. A escolha depende de outros critérios (velocidade, tamanho, licença). Para francês literário ou muito idiomático, Mistral Small continua um nível acima.


#Qual Qwen 3 escolher de acordo com a sua configuração?

6-8 GB de VRAM (RTX 3050, 3060 Ti, 4060)
Qwen3-8B em Q4_K_M. O 14B cabe em Q3, mas a qualidade se degrada — fique com o 8B sem essa perda de qualidade.
12 GB de VRAM (RTX 3060 12, 4070, 5070)
Qwen3-14B em Q4_K_M é o ponto ideal incontestável. Contexto de 16k confortável.
16 GB (RTX 4080, 5070 Ti, 5080)
Qwen3-14B em Q5 ou Q6 para maior conforto, ou um 30B-A3B em Q3_K_M se você quiser testar o MoE.
24 GB (RTX 3090, 4090, RX 7900 XTX)
Qwen3-30B-A3B em Q4_K_M. Não há discussão: é o melhor modelo local de uso geral disponível hoje.
Mac com chip da série M e 32–48 GB de memória unificada
Qwen3-30B-A3B em Q4 ou Q5. O MoE se sai especialmente bem com a memória unificada da Apple.
Mac Studio Ultra 128 GB+
Vá direto para o Qwen3-235B-A22B (~120 GB em Q4) se quiser o topo da linha. Caso contrário, o 30B-A3B em Q8 continua excelente.
→
E o modo de raciocínio nisso tudo?
Por padrão, mantenha-o desativado. Ative-o sob demanda quando for resolver um problema de matemática, lógica ou raciocínio complexo. Para conversas cotidianas, é só latência extra. A mesma lógica se aplica à geração seguinte: o Qwen 3.8 27B tende a pensar demais com sua configuração padrão de raciocínio — mude-a para low nas conversas habituais.

#Para se aprofundar

Se o Qwen 3 for seu ponto de partida, saiba que a geração seguinte já tomou seu lugar nos nossos rankings — o Qwen 3.5 9B tornou-se a escolha padrão para configurações de 8 GB (256k de contexto, visão), e o Qwen 3.8 27B, para as de 24 GB; os ajustes abaixo continuam válidos sem alterações nesses modelos. Algumas sugestões para ir além:

Escolher sua quantização
Para entender exatamente o que você perde entre Q4_K_M e Q5_K_M no Qwen 3 e quando faz sentido usar uma quantização de maior precisão.
Personalizar com um Modelfile
Para definir o modo de pensamento, o contexto e um prompt de sistema padrão em francês na sua instância do Qwen 3 — em vez de refazer os ajustes a cada sessão.
Open WebUI com Ollama
Para passar do terminal a uma verdadeira interface de chat com histórico, markdown e anexos, sem abrir mão do uso local.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.