Intermediário 11 minQwen

Qwen3.6 35B-A3B em execução local: teste e requisitos VRAM

Qwen3.6 35B-A3B é um Mixture-of-Experts (MoE) da Alibaba: 35 bilhões de parâmetros no total, mas apenas 3 bilhões ativados por token. Teoricamente, promete a qualidade de um 30B+ com a velocidade de um 3B. Na prática, a armadilha está em outro lugar: a VRAM. Este guia mede o que realmente é necessário para rodar o qwen3.6 localmente, para cada quantização, e quantos tokens por segundo são gerados nas placas mais comuns.

Por Mohamed Meguedmi·Atualização 2026-06-03·Testado no Windows, macOS e Linux

#Por que usar o Qwen3.6 35B-A3B localmente?

Três razões concretas levam você a testar esse modelo em vez de um modelo denso clássico de 32B. Primeiro, a velocidade: apenas os 3B ativos estão envolvidos no cálculo de cada token, então a inferência é muito mais rápida do que a de um Qwen 32B denso com VRAM equivalente. Em seguida, a qualidade: nos benchmarks públicos, o 35B-A3B compete de igual para igual com um modelo denso de 14B–24B em raciocínio, código e francês.

Por fim, é um dos poucos modelos a oferecer esse equilíbrio sob uma licença permissiva que permite o uso em produção. Se você procura um assistente generalista preciso, que responda rápido e caiba em uma placa de 24 GB, o Qwen3.6 35B-A3B é hoje um dos melhores candidatos.

i
O nome decodificado
35B = 35 bilhões de parâmetros ao todo. A3B = 3 bilhões de parâmetros "ativos" por token. O roteador MoE seleciona dinamicamente alguns especialistas dentre cerca de 64 a cada passagem, o que reduz o custo de computação, mas não o custo de memória.

#Arquitetura MoE em um minuto

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Em um modelo denso, cada token passa por todas as camadas e todos os neurônios. Em um MoE, algumas camadas feed-forward são substituídas por um conjunto de especialistas independentes, e uma pequena rede "roteadora" decide, para cada token, quais especialistas ativar (tipicamente 2 a 8). O restante permanece em repouso.

Custo computacional por token
Proporcional aos parâmetros ativos (3B). É por isso que gera rápido.
Memória (VRAM)
Proporcional ao total (35B). Todos os especialistas devem ser carregados, nunca se sabe de antemão qual será chamado.
Qualidade
Entre um 3B denso e um 35B denso. Em tarefas gerais, na prática, se aproxima de um 14B–24B denso.
Sensibilidade ao batch
Com um único prompt por vez, o MoE brilha. Em batches muito grandes, a vantagem computacional diminui porque todos os especialistas acabam sendo ativados.
→
Por que isso é interessante para a hospedagem própria
Em uma RTX 4090 de 24 GB, um Qwen 32B denso em Q4 costuma ter um teto de 25–35 tok/s. O Qwen3.6 35B-A3B, na mesma VRAM, roda em torno de 70–90 tok/s, com um nível de resposta comparável na maioria das tarefas não especializadas.

#Pré-requisitos de hardware

VRAM mínima
16 GB para testá-lo (Q3, aceitando offload parcial para a CPU). 20 a 24 GB para uso fluido em Q4.
VRAM com folga
32 GB (RTX 5090) ou 48 GB (memória unificada Apple) para Q5/Q6 e contextos longos.
RAM do sistema
No mínimo 32 GB se você aceitar offload para a CPU. 64 GB se carregar apenas na RAM.
Disco
Prever 22 GB para Q4_K_M e 70 GB para FP16. SSD NVMe fortemente recomendado.
Sistema operacional / ambiente de execução
Linux, macOS (Apple Silicon), Windows 11. Ollama ≥ 0.5.x ou uma versão recente do llama.cpp (build posterior a março de 2026).
!
MoE ≠ modelo pequeno
Não se deixe enganar pelo "3B ativos": ainda assim, todo o modelo precisa ser carregado na VRAM. Uma RTX 4060 de 8 GB não é suficiente, mesmo se a inferência "calcule apenas 3B". Todos os especialistas devem permanecer acessíveis instantaneamente.

#VRAM real por quantização

Aqui estão os consumos de memória medidos com o llama.cpp usando um contexto de 8 k tokens (modelo + cache KV + sobrecarga). Os valores incluem a memória usada pelo ambiente de execução, não apenas o tamanho do GGUF no disco.

Q2_K (≈ 13 GB)
Possível em RTX 4070 / 4060 Ti 16 GB. Perda de qualidade significativa, especialmente em código e raciocínio em múltiplas etapas. Reservar para situações de emergência.
Q3_K_M (≈ 17 GB)
Cabe na VRAM de uma RX 7900 GRE / 4080 / 5070 Ti de 16 GB com um contexto modesto. Qualidade ainda razoável para bate-papo geral em francês.
Q4_K_M (≈ 22 GB)
O ponto ideal. Confortável em RTX 3090 / 4090 / 7900 XTX (24 GB) e RTX 5090 (32 GB). Recomendado por padrão.
Q5_K_M (≈ 26 GB)
Requer 32 GB (RTX 5090) ou um Mac M-series com 36 GB ou mais. O ganho de qualidade em relação ao Q4 é modesto, exceto em código.
Q6_K (≈ 30 GB)
Reservado para RTX 5090, Mac Studio ou configurações com múltiplas GPUs. Muito pouca diferença em relação ao Q8 nas respostas apresentadas ao usuário.
Q8_0 (≈ 37 GB)
Mac Studio M2/M3/M5 Ultra, ou duas GPUs (2× 3090). Qualidade próxima à do FP16.
FP16 (≈ 70 GB)
Pesquisa, fine-tuning, vLLM em produção. Fora do alcance para a maioria dos setups locais.
→
Qual quantização escolher
Para 95% dos usos, Q4_K_M é uma boa escolha padrão: preserva a maior parte da qualidade, economiza VRAM e aumenta a taxa de geração. Só passe para Q5/Q6 se você tiver constatado claramente regressões nos seus prompts.

#Instalação com Ollama

O Ollama continua sendo o caminho mais curto. Se você ainda não o tiver, instale-o (veja o guia de instalação correspondente ao seu sistema operacional). Com o daemon em execução na porta 11434, basta um único comando.

Baixar e executar
ollama run qwen3.6:35b-a3b-q4_K_M

O download pesa cerca de 21 GB. No primeiro prompt, o modelo é carregado na VRAM; as inicializações seguintes são quase instantâneas enquanto o modelo permanecer ativo na memória.

Verificar a alocação na GPU
ollama ps

A coluna PROCESSOR deve mostrar 100% GPU. Se você vir uma combinação de CPU/GPU, é porque a VRAM é insuficiente: passe para uma quantização mais agressiva (Q3_K_M), reduza num_ctx ou aceite a redução da velocidade de geração.

i
Expandir o contexto
Por padrão, o Ollama limita o contexto a 2048 tokens. Para resumir documentos ou manter conversas longas, crie um Modelfile que fixe num_ctx em 8192 ou 16384 — cada duplicação exige algumas centenas de MB adicionais de VRAM.
Modelfile mínimo
# fichier : Modelfile.qwen36-long
FROM qwen3.6:35b-a3b-q4_K_M
PARAMETER num_ctx 16384
PARAMETER temperature 0.7

# build
# ollama create qwen36-long -f Modelfile.qwen36-long

#Instalação com llama.cpp

Para quem quer controlar com precisão o posicionamento dos especialistas, o batch ou o KV-cache, o llama.cpp é mais flexível. Você baixa um GGUF Q4_K_M do Hugging Face (modelos publicados pela equipe Qwen ou por bartowski/unsloth) e depois inicia o servidor compatível com OpenAI.

Servidor llama.cpp
./llama-server \
  -m ./models/Qwen3.6-35B-A3B-Q4_K_M.gguf \
  --host 0.0.0.0 --port 8080 \
  -c 16384 \
  -ngl 99 \
  --flash-attn \
  --threads 8
-ngl 99
Transfere todas as camadas para a GPU. Definir 0 para usar apenas a CPU, ou um valor parcial para distribuir as camadas entre CPU e GPU.
-c 16384
Tamanho do contexto. Conte com ~0,5 GB adicionais de cache KV por bloco de 4 k além do padrão.
--flash-attn
Ativa o Flash Attention se sua build oferecer suporte a ele (CUDA, Metal). Economia significativa de memória em contextos longos.
--threads 8
É útil principalmente quando parte do processamento ocorre na CPU. Quando tudo roda na GPU, tem pouco impacto.
→
MoE e offload de especialistas
As compilações recentes do llama.cpp aceitam --override-tensor para colocar alguns especialistas na RAM. Em uma 4070 de 12 GB, isso permite acomodar o modelo em Q4_K_M (à custa de parte da taxa de processamento). Procure a documentação sobre "expert offload" se quiser se aprofundar.

#Velocidade de inferência medida

Medidas feitas em Q4_K_M, contexto 4096, prompt curto (~200 tokens), geração de 512 tokens, lote 1. Os números incluem a fase de avaliação do prompt e a geração.

RTX 5090 32 GB
≈ 110–125 tok/s em geração. A fase de avaliação do prompt ultrapassa 4000 tok/s. Confortável até 32 k de contexto.
RTX 4090 24 GB
≈ 80–95 tok/s. O modelo Q4 cabe na VRAM com 16 k de contexto, sem exceder sua capacidade.
RTX 3090 24 GB
≈ 55–70 tok/s. Excelente relação desempenho/€ no mercado de usados, mas largura de banda da memória menor que a da 4090.
Mac Studio M5 Max 64 GB
≈ 60–75 tok/s em Q4_K_M, ≈ 45–55 tok/s em Q8_0. Ideal para servidor 24/7 silencioso.
Radeon RX 7900 XTX 24 GB (ROCm)
≈ 45–60 tok/s. Ollama suportado, llama.cpp com ROCm/Vulkan.
RTX 4070 Ti Super 16 GB (Q3_K_M)
≈ 50–65 tok/s, contexto limitado a 4 k. Neste nível, um Qwen 14B denso permanece frequentemente mais relevante.
i
MoE e contexto longo
A taxa de geração permanece alta, mas o tempo de avaliação do prompt aumenta rapidamente quando se injeta 16 k de contexto. Isso é normal: todos os especialistas são solicitados em algum momento durante o processamento do prompt. Para RAG, processe suas requisições em lotes.

#Otimizações úteis

  1. 01
    Ativar Flash Attention
    No Ollama, isso é automático em GPUs recentes. No llama.cpp, adicionar --flash-attn. Economia significativa de VRAM a partir de 8 k de contexto.
  2. 02
    Quantizar o KV-cache
    O llama.cpp aceita --cache-type-k q8_0 --cache-type-v q8_0. Economiza ~30 % de VRAM no cache, com perda quase nula de qualidade.
  3. 03
    Reduzir o número de especialistas ativos
    Algumas variantes aceitam --override-kv qwen3moe.expert_used_count=2 (em vez de 4 ou 8 por padrão). Mais rápido, com leve perda de qualidade.
  4. 04
    Limitar num_ctx ao que você precisa
    16 k é amplamente suficiente para a maioria dos chats. 32 k+ só se justifica para a síntese de documentos longos.
  5. 05
    Preferir batch=1 para o chat interativo
    O MoE perde parte de sua vantagem com lotes grandes: se você atende vários usuários ao mesmo tempo, considere vLLM em vez de Ollama.

#Solução de problemas

Falta de memória (OOM) ao carregar na RTX 4090
Reduza num_ctx para 4096 e verifique se nenhum outro processo que usa a GPU está rodando (navegador, jogo). O Q4_K_M deve caber com 2 a 3 GB de margem.
Geração a 5 tok/s na RTX 4090
Parte do modelo está sendo executada na CPU. ollama ps exibirá uma combinação de CPU/GPU. Feche tudo, reinicie o Ollama ou reduza para Q3_K_M.
Respostas incoerentes em francês
Verifique se você está usando a variante Instruct e não Base. O roteamento MoE é sensível à formulação do prompt de sistema — mantenha o texto direto.
Primeiro token muito lento (>10s)
Avaliação de prompt longa: é esperado em um contexto amplo no MoE. Reuse o cache de prompt entre requisições (opção --prompt-cache do llama.cpp).
Modelo não encontrado no Ollama
O rótulo exato pode variar (qwen3.6 vs qwen3_6 vs qwen36). Procure no ollama.com/library antes de digitar o comando.

#Para se aprofundar

Agora que o Qwen3.6 35B-A3B está rodando em sua máquina, algumas dicas para otimizar o setup:

Escolher sua quantização (Q4, Q5, Q8, FP16)
Para entender com precisão o que acontece entre Q3, Q4 e Q5 em um modelo MoE.
Open WebUI com Ollama
Uma interface semelhante à do ChatGPT, com histórico e RAG, que funciona sobre o seu Qwen3.6 local.
Escolher sua GPU para IA local
Se você estiver em dúvida entre uma 3090 usada, uma 4090 ou uma 5090 para esse tipo de modelo MoE 30B+.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.