🇨🇳 GLM 4.7 Flash
GLM-4.7-Flash (MoE 31B, ~3B ativos): a melhor relação entre desempenho em programação e VRAM da classe 30B. MIT, 128k ctx, muito rápido em 3090/4090.
ollama run glm-4.7-flash
Classificação atualizada em 09/10/2026
48 GB de memória unificada (M4 Pro na configuração mais avançada, M2 Max na configuração básica, M3 Pro na configuração mais avançada) permitem usar modelos de 30B em Q5/Q6 e experimentar modelos de 70B em Q2/Q3. Um patamar robusto para o público geral interessado em IA local.
Compare os preços de Mac mini M5 Pro (24 GB / 512 GB) em nossos lojistas parceiros (fichas de produto verificadas):
Por que essa escolha? Nossa ficha completa sobre o Mac mini M5 Pro (24 GB / 512 GB) →
Qual PC escolher conforme seu orçamento? Nossas escolhas de 800 a 3 500 € →
Links afiliados — QualLLM pode receber uma comissão sobre as compras, sem custo adicional para você, o que não influencia a classificação (estabelecida de forma independente). Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
GLM-4.7-Flash (MoE 31B, ~3B ativos): a melhor relação entre desempenho em programação e VRAM da classe 30B. MIT, 128k ctx, muito rápido em 3090/4090.
ollama run glm-4.7-flash
Híbrido Mamba-2 + MoE 32B/9B ativos. ~70% menos RAM com contextos longos. Apache 2.0.
ollama run granite4:small-h
MoE 30B/3B ativos, raciocínio híbrido. MMLU 81.4, AIME24 80.4. 100+ idiomas.
ollama run qwen3:30b-a3b
Variante MoE de Gemma 4. 26B/4B ativos. Multimodal completo (texto+imagem+áudio).
ollama run gemma4:26b
Primeiro dLLM aberto sob a licença Apache 2.0: MoE 16B/1B + decodificador de difusão 6.2B. Texto+visão unificados. Lançamento em 22 de abril de 2026.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
MoE 30B/3B ativos: thinking mode + instruct. Medalha de ouro na IMO 2025 e na IOI 2025. Inferência rápida graças aos 3B ativos, capacidades de raciocínio de nível 30B. Lançamento em abril de 2026.
ollama run nemotron-cascade-2
MoE de 30B (3,3B ativos), especializado em programação agêntica. Muito rápido ao rodar localmente, 256k de contexto nativo, a referência para 16–24 GB via Ollama.
ollama run qwen3-coder:30b
Visão MoE 30B/3B ativos. Ponto de equilíbrio ideal para visão no Qwen 3. 256k ctx.
ollama run qwen3-vl:30b
| Posição | Modelo | Params | VRAM Q4 | Contexto | Licença | No Apple M4 Pro (48 GB) |
|---|---|---|---|---|---|---|
| #1 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT | 40 tok/s · Q8 |
| #2 | Granite 4.0 H-Small 32B-A9B | 32B | 19 GB | 128 000 | Apache 2.0 | 30 tok/s · Q8 |
| #3 | Qwen 3 30B-A3B | 30B | 19 GB | 131 072 | Apache 2.0 | 40 tok/s · Q8 |
| #4 | Gemma 4 26B-A4B MoE | 26B | 16 GB | 128 000 | Apache 2.0 | 22 tok/s · Q8 |
| #5 | LLaDA 2.0 Uni 16B | 16B | 18 GB | 8 192 | Apache 2.0 | 60 tok/s · Q8 |
| #6 | Nemotron Cascade 2 30B-A3B | 30B | 17 GB | 128 000 | NVIDIA Open Model License | 30 tok/s · Q8 |
| #7 | Qwen3-Coder 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 | 40 tok/s · Q8 |
| #8 | Qwen 3 VL 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 | 40 tok/s · Q8 |
IA local no seu Mac, a fundo: memória unificada, MLX vs GGUF, o modelo certo para seu chip, Ollama e LM Studio ajustados para Apple Silicon.
Memo gratuito
Receba o resumo VRAM → melhor modelo de código → comando Ollama (uma única tela, copiar e colar). E passe para o kit Copiloto Local para transformar isso em uma configuração que realmente funciona.
O kit Copiloto Local — as configs Ollama + Cline + Aider prontas para colar, Modelfiles ajustados, solução de problemas, espaço online vitalício →Sem spam. Cancelamento em 1 clique. Seus dados ficam conosco (nunca revendidos).
Sua placa → o melhor modelo para programação para rodar localmente e o comando Ollama exato:
| Sua VRAM | GPU / Mac típicos | Modelo de código recomendado | Comando Ollama |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) ou Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — especialista em agentes de código | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — o “quase Copilot” | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — MoE rápido | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — ainda é a referência neste caso específico. ⚠️ Qwen 3.8: seu nível de raciocínio é definido como muito alto por padrão e ele “pensa demais” em solicitações simples — reduza-o para low (ou desative-o) na primeira execução. ⚠️ Armadilha de licença: Codestral 22B = Mistral Non-Production License → proibido para programar no trabalho. Qwen 3.5/3.8, Gemma 4 e Devstral são disponibilizados sob a licença Apache 2.0. 💡 Está travando por falta de memória? Mantenha ~1,5 GB de VRAM livre para o contexto, ou passe para um nível menor de quantização.🔌 Para conectá-lo no VS Code: Cline (agente que trabalha com vários arquivos), Aider (CLI) ou Tabby/Twinny (autocompletação FIM) — todos se conectam ao Ollama localmente. O kit Copiloto Local — configs prontas para colar + setup testado — está disponível: /copilote-local.
Filtro: modelos de 7 a 75B cuja versão Q4_K_M cabe em menos de 36 GB (deixa 12 GB para macOS + contexto). Bônus para modelos de 13 a 32B (pico dos modelos densos em Q5/Q6) e MoE 30B-A3B (pico em Q8).
Critérios considerados:
A pontuação é totalmente transparente: consulte nossa metodologia para os detalhes de cálculo de VRAM/tokens/seg.
Mac 48 GB: é possível rodar Llama 70B?
Em Q3_K_M (~32 GB), sim, a 6–10 tokens/seg — utilizável para conteúdo longo, mas lento para chat. Prefira os modelos MoE 30B-A3B Q8 (~32 GB também), que rodam 3 vezes mais rápido com qualidade comparável.
M4 Pro 48 GB vs M2 Max 48 GB ?
M4 Pro 273 GB/s vs M2 Max 400 GB/s. M2 Max ~40% mais rápido em 30B Q5 (~22 vs 16 tok/s), porém com consumo superior e ventilação mais ativa. M4 Pro mais eficiente em desempenho por watt. Veja MBP M4.
48 GB são suficientes para fazer o ajuste fino de um 7B localmente?
QLoRA com Unsloth, sim: 7B + adaptador LoRA + otimizador + gradiente = ~20-30 GB. Com folga. Para QLoRA em 13B, planeje usar 64 GB ou mais. Veja Mac 64 GB.
Qwen 3 30B-A3B (MoE) ou Qwen 3 32B (denso) em 48 GB?
O MoE 30B-A3B é 2 a 3 vezes mais rápido (~30-45 tok/s versus 12-18 tok/s), pois apenas 3B de parâmetros ficam ativos por token. O modelo denso de 32B é ligeiramente mais capaz em raciocínio complexo. MoE = escolha padrão na prática.
Aprofunde-se com nossos duelos detalhados dos finalistas: