Qwen3.6 35B-A3B em execução local: teste e requisitos VRAM
Qwen3.6 35B-A3B é um Mixture-of-Experts (MoE) da Alibaba: 35 bilhões de parâmetros no total, mas apenas 3 bilhões ativados por token. Teoricamente, promete a qualidade de um 30B+ com a velocidade de um 3B. Na prática, a armadilha está em outro lugar: a VRAM. Este guia mede o que realmente é necessário para rodar o qwen3.6 localmente, para cada quantização, e quantos tokens por segundo são gerados nas placas mais comuns.
#Por que usar o Qwen3.6 35B-A3B localmente?
Três razões concretas levam você a testar esse modelo em vez de um modelo denso clássico de 32B. Primeiro, a velocidade: apenas os 3B ativos estão envolvidos no cálculo de cada token, então a inferência é muito mais rápida do que a de um Qwen 32B denso com VRAM equivalente. Em seguida, a qualidade: nos benchmarks públicos, o 35B-A3B compete de igual para igual com um modelo denso de 14B–24B em raciocínio, código e francês.
Por fim, é um dos poucos modelos a oferecer esse equilíbrio sob uma licença permissiva que permite o uso em produção. Se você procura um assistente generalista preciso, que responda rápido e caiba em uma placa de 24 GB, o Qwen3.6 35B-A3B é hoje um dos melhores candidatos.
#Arquitetura MoE em um minuto
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
Em um modelo denso, cada token passa por todas as camadas e todos os neurônios. Em um MoE, algumas camadas feed-forward são substituídas por um conjunto de especialistas independentes, e uma pequena rede "roteadora" decide, para cada token, quais especialistas ativar (tipicamente 2 a 8). O restante permanece em repouso.
- Custo computacional por token
- Proporcional aos parâmetros ativos (3B). É por isso que gera rápido.
- Memória (VRAM)
- Proporcional ao total (35B). Todos os especialistas devem ser carregados, nunca se sabe de antemão qual será chamado.
- Qualidade
- Entre um 3B denso e um 35B denso. Em tarefas gerais, na prática, se aproxima de um 14B–24B denso.
- Sensibilidade ao batch
- Com um único prompt por vez, o MoE brilha. Em batches muito grandes, a vantagem computacional diminui porque todos os especialistas acabam sendo ativados.
#Pré-requisitos de hardware
- VRAM mínima
- 16 GB para testá-lo (Q3, aceitando offload parcial para a CPU). 20 a 24 GB para uso fluido em Q4.
- VRAM com folga
- 32 GB (RTX 5090) ou 48 GB (memória unificada Apple) para Q5/Q6 e contextos longos.
- RAM do sistema
- No mínimo 32 GB se você aceitar offload para a CPU. 64 GB se carregar apenas na RAM.
- Disco
- Prever 22 GB para Q4_K_M e 70 GB para FP16. SSD NVMe fortemente recomendado.
- Sistema operacional / ambiente de execução
- Linux, macOS (Apple Silicon), Windows 11. Ollama ≥ 0.5.x ou uma versão recente do llama.cpp (build posterior a março de 2026).
#VRAM real por quantização
Aqui estão os consumos de memória medidos com o llama.cpp usando um contexto de 8 k tokens (modelo + cache KV + sobrecarga). Os valores incluem a memória usada pelo ambiente de execução, não apenas o tamanho do GGUF no disco.
- Q2_K (≈ 13 GB)
- Possível em RTX 4070 / 4060 Ti 16 GB. Perda de qualidade significativa, especialmente em código e raciocínio em múltiplas etapas. Reservar para situações de emergência.
- Q3_K_M (≈ 17 GB)
- Cabe na VRAM de uma RX 7900 GRE / 4080 / 5070 Ti de 16 GB com um contexto modesto. Qualidade ainda razoável para bate-papo geral em francês.
- Q4_K_M (≈ 22 GB)
- O ponto ideal. Confortável em RTX 3090 / 4090 / 7900 XTX (24 GB) e RTX 5090 (32 GB). Recomendado por padrão.
- Q5_K_M (≈ 26 GB)
- Requer 32 GB (RTX 5090) ou um Mac M-series com 36 GB ou mais. O ganho de qualidade em relação ao Q4 é modesto, exceto em código.
- Q6_K (≈ 30 GB)
- Reservado para RTX 5090, Mac Studio ou configurações com múltiplas GPUs. Muito pouca diferença em relação ao Q8 nas respostas apresentadas ao usuário.
- Q8_0 (≈ 37 GB)
- Mac Studio M2/M3/M5 Ultra, ou duas GPUs (2× 3090). Qualidade próxima à do FP16.
- FP16 (≈ 70 GB)
- Pesquisa, fine-tuning, vLLM em produção. Fora do alcance para a maioria dos setups locais.
#Instalação com Ollama
O Ollama continua sendo o caminho mais curto. Se você ainda não o tiver, instale-o (veja o guia de instalação correspondente ao seu sistema operacional). Com o daemon em execução na porta 11434, basta um único comando.
O download pesa cerca de 21 GB. No primeiro prompt, o modelo é carregado na VRAM; as inicializações seguintes são quase instantâneas enquanto o modelo permanecer ativo na memória.
A coluna PROCESSOR deve mostrar 100% GPU. Se você vir uma combinação de CPU/GPU, é porque a VRAM é insuficiente: passe para uma quantização mais agressiva (Q3_K_M), reduza num_ctx ou aceite a redução da velocidade de geração.
#Instalação com llama.cpp
Para quem quer controlar com precisão o posicionamento dos especialistas, o batch ou o KV-cache, o llama.cpp é mais flexível. Você baixa um GGUF Q4_K_M do Hugging Face (modelos publicados pela equipe Qwen ou por bartowski/unsloth) e depois inicia o servidor compatível com OpenAI.
- -ngl 99
- Transfere todas as camadas para a GPU. Definir 0 para usar apenas a CPU, ou um valor parcial para distribuir as camadas entre CPU e GPU.
- -c 16384
- Tamanho do contexto. Conte com ~0,5 GB adicionais de cache KV por bloco de 4 k além do padrão.
- --flash-attn
- Ativa o Flash Attention se sua build oferecer suporte a ele (CUDA, Metal). Economia significativa de memória em contextos longos.
- --threads 8
- É útil principalmente quando parte do processamento ocorre na CPU. Quando tudo roda na GPU, tem pouco impacto.
#Velocidade de inferência medida
Medidas feitas em Q4_K_M, contexto 4096, prompt curto (~200 tokens), geração de 512 tokens, lote 1. Os números incluem a fase de avaliação do prompt e a geração.
- RTX 5090 32 GB
- ≈ 110–125 tok/s em geração. A fase de avaliação do prompt ultrapassa 4000 tok/s. Confortável até 32 k de contexto.
- RTX 4090 24 GB
- ≈ 80–95 tok/s. O modelo Q4 cabe na VRAM com 16 k de contexto, sem exceder sua capacidade.
- RTX 3090 24 GB
- ≈ 55–70 tok/s. Excelente relação desempenho/€ no mercado de usados, mas largura de banda da memória menor que a da 4090.
- Mac Studio M5 Max 64 GB
- ≈ 60–75 tok/s em Q4_K_M, ≈ 45–55 tok/s em Q8_0. Ideal para servidor 24/7 silencioso.
- Radeon RX 7900 XTX 24 GB (ROCm)
- ≈ 45–60 tok/s. Ollama suportado, llama.cpp com ROCm/Vulkan.
- RTX 4070 Ti Super 16 GB (Q3_K_M)
- ≈ 50–65 tok/s, contexto limitado a 4 k. Neste nível, um Qwen 14B denso permanece frequentemente mais relevante.
#Otimizações úteis
- 01Ativar Flash AttentionNo Ollama, isso é automático em GPUs recentes. No llama.cpp, adicionar --flash-attn. Economia significativa de VRAM a partir de 8 k de contexto.
- 02Quantizar o KV-cacheO llama.cpp aceita --cache-type-k q8_0 --cache-type-v q8_0. Economiza ~30 % de VRAM no cache, com perda quase nula de qualidade.
- 03Reduzir o número de especialistas ativosAlgumas variantes aceitam --override-kv qwen3moe.expert_used_count=2 (em vez de 4 ou 8 por padrão). Mais rápido, com leve perda de qualidade.
- 04Limitar num_ctx ao que você precisa16 k é amplamente suficiente para a maioria dos chats. 32 k+ só se justifica para a síntese de documentos longos.
- 05Preferir batch=1 para o chat interativoO MoE perde parte de sua vantagem com lotes grandes: se você atende vários usuários ao mesmo tempo, considere vLLM em vez de Ollama.
#Solução de problemas
- Falta de memória (OOM) ao carregar na RTX 4090
- Reduza num_ctx para 4096 e verifique se nenhum outro processo que usa a GPU está rodando (navegador, jogo). O Q4_K_M deve caber com 2 a 3 GB de margem.
- Geração a 5 tok/s na RTX 4090
- Parte do modelo está sendo executada na CPU. ollama ps exibirá uma combinação de CPU/GPU. Feche tudo, reinicie o Ollama ou reduza para Q3_K_M.
- Respostas incoerentes em francês
- Verifique se você está usando a variante Instruct e não Base. O roteamento MoE é sensível à formulação do prompt de sistema — mantenha o texto direto.
- Primeiro token muito lento (>10s)
- Avaliação de prompt longa: é esperado em um contexto amplo no MoE. Reuse o cache de prompt entre requisições (opção --prompt-cache do llama.cpp).
- Modelo não encontrado no Ollama
- O rótulo exato pode variar (qwen3.6 vs qwen3_6 vs qwen36). Procure no ollama.com/library antes de digitar o comando.
#Para se aprofundar
Agora que o Qwen3.6 35B-A3B está rodando em sua máquina, algumas dicas para otimizar o setup:
- Escolher sua quantização (Q4, Q5, Q8, FP16)
- Para entender com precisão o que acontece entre Q3, Q4 e Q5 em um modelo MoE.
- Open WebUI com Ollama
- Uma interface semelhante à do ChatGPT, com histórico e RAG, que funciona sobre o seu Qwen3.6 local.
- Escolher sua GPU para IA local
- Se você estiver em dúvida entre uma 3090 usada, uma 4090 ou uma 5090 para esse tipo de modelo MoE 30B+.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.