🇺🇸 Gemma 4 26B-A4B MoE
Variante MoE de Gemma 4. 26B/4B ativos. Multimodal completo (texto+imagem+áudio).
ollama run gemma4:26b
Classificação atualizada em 09/10/2026
O MacBook Pro M1 Pro / Max (16-64 GB, 200-400 GB/s) tem 4 anos, mas continua utilizável. Modelos de 7 a 32B em Q4 rodam confortavelmente; um modelo de 70B em Q3 é viável no Max de 64 GB.
Compare os preços de MacBook Pro M5 Pro — 24 GB / 1 TB em nossos lojistas parceiros (fichas de produto verificadas):
Qual PC escolher conforme seu orçamento? Nossas escolhas de 800 a 3 500 € →
Links afiliados — QualLLM pode receber uma comissão sobre as compras, sem custo adicional para você, o que não influencia a classificação (estabelecida de forma independente). Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
Variante MoE de Gemma 4. 26B/4B ativos. Multimodal completo (texto+imagem+áudio).
ollama run gemma4:26b
Primeiro dLLM aberto sob a licença Apache 2.0: MoE 16B/1B + decodificador de difusão 6.2B. Texto+visão unificados. Lançamento em 22 de abril de 2026.
# HuggingFace: inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
Denso 27B multimodal, lançado em 22 de abril de 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Qwen 3.8 27B: modelo denso multimodal (texto + visão), contexto de 262k, cerca de 16 GB de VRAM em Q4 (18 GB de pesos no Ollama). Apache 2.0, programação agêntica e visão.
ollama run qwen3.8:27b
GLM-4.7-Flash (MoE 31B, ~3B ativos): a melhor relação entre desempenho em programação e VRAM da classe 30B. MIT, 128k ctx, muito rápido em 3090/4090.
ollama run glm-4.7-flash
Denso 31B multimodal (texto+imagem+áudio). 140+ idiomas, 256k ctx. Nº 3 entre os modelos abertos no Chatbot Arena.
ollama run gemma4:31b
Modelo denso de 30B, Apache 2.0, 12 idiomas incluindo francês, 131k de contexto, GQA 32Q/8KV. Chamada de ferramentas compatível com OpenAI. Lançamento em 29 de abril de 2026.
ollama run granite4.1:30b
| Posição | Modelo | Params | VRAM Q4 | Contexto | Licença | No Apple M1 (16 GB) |
|---|---|---|---|---|---|---|
| #1 | Gemma 4 26B-A4B MoE | 26B | 16 GB | 128 000 | Apache 2.0 | ✗ |
| #2 | LLaDA 2.0 Uni 16B | 16B | 18 GB | 8 192 | Apache 2.0 | ✗ |
| #3 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 | ✗ |
| #4 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 | ✗ |
| #5 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT | ✗ |
| #6 | Gemma 4 31B | 31B | 18 GB | 256 000 | Apache 2.0 | ✗ |
| #7 | Granite 4.1 30B Instruct | 30B | 17 GB | 131 072 | Apache 2.0 | ✗ |
IA local no seu Mac, a fundo: memória unificada, MLX vs GGUF, o modelo certo para seu chip, Ollama e LM Studio ajustados para Apple Silicon.
Memo gratuito
Receba o resumo VRAM → melhor modelo de código → comando Ollama (uma única tela, copiar e colar). E passe para o kit Copiloto Local para transformar isso em uma configuração que realmente funciona.
O kit Copiloto Local — as configs Ollama + Cline + Aider prontas para colar, Modelfiles ajustados, solução de problemas, espaço online vitalício →Sem spam. Cancelamento em 1 clique. Seus dados ficam conosco (nunca revendidos).
Sua placa → o melhor modelo para programação para rodar localmente e o comando Ollama exato:
| Sua VRAM | GPU / Mac típicos | Modelo de código recomendado | Comando Ollama |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) ou Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — especialista em agentes de código | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — o “quase Copilot” | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — MoE rápido | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base: ollama run qwen2.5-coder:7b-base — ainda é a referência neste caso específico. ⚠️ Qwen 3.8: seu nível de raciocínio é definido como muito alto por padrão e ele “pensa demais” em solicitações simples — reduza-o para low (ou desative-o) na primeira execução. ⚠️ Armadilha de licença: Codestral 22B = Mistral Non-Production License → proibido para programar no trabalho. Qwen 3.5/3.8, Gemma 4 e Devstral são disponibilizados sob a licença Apache 2.0. 💡 Está travando por falta de memória? Mantenha ~1,5 GB de VRAM livre para o contexto, ou passe para um nível menor de quantização.🔌 Para conectá-lo no VS Code: Cline (agente que trabalha com vários arquivos), Aider (CLI) ou Tabby/Twinny (autocompletação FIM) — todos se conectam ao Ollama localmente. O kit Copiloto Local — configs prontas para colar + setup testado — está disponível: /copilote-local.
Filtro: 3-70B, dos quais Q4_K_M cabe em menos de 40 GB. Bônus 7-32B (pico do M1 Max). Mantemos cautela com 70B (largura de banda limitada em comparação com M3/M4).
Critérios considerados:
A pontuação é totalmente transparente: consulte nossa metodologia para os detalhes de cálculo de VRAM/tokens/seg.
MBP M1 Pro 16 GB em 2026: vale a pena?
Sim para 7–8B: Mistral 7B Q4, Qwen 3 8B Q4 a 22–28 tok/s. Consulte o guia MBP M1.
O MBP M1 Max de 64 GB consegue executar um 70B?
Sim, em Q3_K_M (~32 GB), a 6-9 tok/s — utilizável para textos longos, lento para bate-papo interativo. Q4 (~40 GB) funciona, mas é mais lento.
M1 Pro vs M1 Max em 32B?
M1 Pro (200 GB/s) ≈ 12 tok/s no Mistral Small 24B Q4. M1 Max (400 GB/s) ≈ 22 tok/s. O Max dobra a largura de banda de memória, e a diferença é perceptível.
É necessário fazer upgrade para o M4?
Se o M1 Max de 64 GB ainda dá conta, não. Caso contrário, o M4 Pro de 48 GB oferece 273 GB/s + Neural Engine recente — melhor desempenho/Watt. Veja MBP M4.