🇺🇸 Laguna XS.2
MoE de 33B/3B ativos, com licença Apache 2.0, especializado em programação agêntica. 68,2% no SWE-Bench Verified, 128k de contexto. Roda em um Mac com 36 GB. Lançamento em 28 de abril de 2026.
ollama run laguna-xs.2
Classificação atualizada em 09/10/2026
128 GB de memória unificada é o patamar premium das estações de trabalho para IA — e já não se limita aos computadores de mesa: o MacBook Pro de 14 ou 16 polegadas chega a esse patamar tanto com o M5 Max quanto com o M4 Max, desde que você escolha a variante com GPU de 40 núcleos (614 GB/s no M5 Max, contra 460 GB/s na variante de 32 núcleos). Llama 70B em Q8 (~75 GB), MoE 150B em Q4, contexto de 200k para RAG empresarial.
Compare os preços de MacBook Pro M5 Pro — 24 GB / 1 TB em nossos lojistas parceiros (fichas de produto verificadas):
Qual PC escolher conforme seu orçamento? Nossas escolhas de 800 a 3 500 € →
Links afiliados — QualLLM pode receber uma comissão sobre as compras, sem custo adicional para você, o que não influencia a classificação (estabelecida de forma independente). Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
MoE de 33B/3B ativos, com licença Apache 2.0, especializado em programação agêntica. 68,2% no SWE-Bench Verified, 128k de contexto. Roda em um Mac com 36 GB. Lançamento em 28 de abril de 2026.
ollama run laguna-xs.2
GLM-4.7-Flash (MoE 31B, ~3B ativos): a melhor relação entre desempenho em programação e VRAM da classe 30B. MIT, 128k ctx, muito rápido em 3090/4090.
ollama run glm-4.7-flash
Híbrido Mamba-2 + MoE 32B/9B ativos. ~70% menos RAM com contextos longos. Apache 2.0.
ollama run granite4:small-h
MoE 35B/3B ativos para programação com agentes. 73,4% no SWE-Bench. Lançamento em 16 de abril de 2026.
ollama run qwen3.6:35b-a3b
MoE 30B/3B ativos, raciocínio híbrido. MMLU 81.4, AIME24 80.4. 100+ idiomas.
ollama run qwen3:30b-a3b
MoE 30B/3B ativos: thinking mode + instruct. Medalha de ouro na IMO 2025 e na IOI 2025. Inferência rápida graças aos 3B ativos, capacidades de raciocínio de nível 30B. Lançamento em abril de 2026.
ollama run nemotron-cascade-2
MoE de 30B (3,3B ativos), especializado em programação agêntica. Muito rápido ao rodar localmente, 256k de contexto nativo, a referência para 16–24 GB via Ollama.
ollama run qwen3-coder:30b
Visão MoE 30B/3B ativos. Ponto de equilíbrio ideal para visão no Qwen 3. 256k ctx.
ollama run qwen3-vl:30b
| Posição | Modelo | Params | VRAM Q4 | Contexto | Licença | No Apple M5 Max (128 GB) |
|---|---|---|---|---|---|---|
| #1 | Laguna XS.2 | 33B | 19 GB | 131 072 | Apache 2.0 | 100 tok/s · FP16 |
| #2 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT | 100 tok/s · FP16 |
| #3 | Granite 4.0 H-Small 32B-A9B | 32B | 19 GB | 128 000 | Apache 2.0 | 75 tok/s · FP16 |
| #4 | Qwen 3.6 35B-A3B | 35B | 21 GB | 262 000 | Apache 2.0 | 60 tok/s · FP16 |
| #5 | Qwen 3 30B-A3B | 30B | 19 GB | 131 072 | Apache 2.0 | 100 tok/s · FP16 |
| #6 | Nemotron Cascade 2 30B-A3B | 30B | 17 GB | 128 000 | NVIDIA Open Model License | 80 tok/s · FP16 |
| #7 | Qwen3-Coder 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 | 100 tok/s · FP16 |
| #8 | Qwen 3 VL 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 | 100 tok/s · FP16 |
IA local no seu Mac, a fundo: memória unificada, MLX vs GGUF, o modelo certo para seu chip, Ollama e LM Studio ajustados para Apple Silicon.
Memo gratuito
Receba o resumo VRAM → melhor modelo de código → comando Ollama (uma única tela, copiar e colar). E passe para o kit Copiloto Local para transformar isso em uma configuração que realmente funciona.
O kit Copiloto Local — as configs Ollama + Cline + Aider prontas para colar, Modelfiles ajustados, solução de problemas, espaço online vitalício →Sem spam. Cancelamento em 1 clique. Seus dados ficam conosco (nunca revendidos).
Sua placa → o melhor modelo para programação para rodar localmente e o comando Ollama exato:
| Sua VRAM | GPU / Mac típicos | Modelo de código recomendado | Comando Ollama |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) ou Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — especialista em agentes de código | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — o “quase Copilot” | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — MoE rápido | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — ainda é a referência neste caso específico. ⚠️ Qwen 3.8: seu nível de raciocínio é definido como muito alto por padrão e ele “pensa demais” em solicitações simples — reduza-o para low (ou desative-o) na primeira execução. ⚠️ Armadilha de licença: Codestral 22B = Mistral Non-Production License → proibido para programar no trabalho. Qwen 3.5/3.8, Gemma 4 e Devstral são disponibilizados sob a licença Apache 2.0. 💡 Está travando por falta de memória? Mantenha ~1,5 GB de VRAM livre para o contexto, ou passe para um nível menor de quantização.🔌 Para conectá-lo no VS Code: Cline (agente que trabalha com vários arquivos), Aider (CLI) ou Tabby/Twinny (autocompletação FIM) — todos se conectam ao Ollama localmente. O kit Copiloto Local — configs prontas para colar + setup testado — está disponível: /copilote-local.
Filtro: modelos de 30 a 250B cuja versão Q4_K_M ocupa menos de 96 GB (deixa 32 GB para o macOS + contexto massivo). Bônus para modelos de 70 a 150B (pico de 128 GB) e MoE até 250B.
Critérios considerados:
A pontuação é totalmente transparente: consulte nossa metodologia para os detalhes de cálculo de VRAM/tokens/seg.
Mac 128 GB: Llama 70B Q8 ou 123B Q5?
Llama 70B Q8 (~75 GB) a 10-14 tokens/s no M4 Max. Mistral Large 123B Q5 (~85 GB) a 8-12 tokens/s. O Q8 em 70B é geralmente mais útil (quase equivalente a FP16, ligeiramente melhor que Q6 em outros casos). O 123B continua sendo mais capaz no geral.
MoE de fronteira com 128 GB: viável?
DeepSeek V4 Flash 284B (13B ativos MoE) Q3_K_M (~140 GB) não cabe — é necessário um Mac Studio com 192 GB ou mais. Granite 4 Mamba 150B Q4 (~80 GB) cabe. Para modelos de fronteira com 200B+, passe para Mac Studio Ultra.
MacBook Pro M5 Max 128 GB: realmente 128 GB em um notebook?
Sim, e é o único notebook do mercado nesse nível. O MacBook Pro 14 e 16 polegadas atinge 128 GB de memória unificada no M5 Max como no M4 Max, mas apenas na versão com GPU de 40 núcleos — no M5 Max, a única com 614 GB/s (460 GB/s na versão com 32 núcleos). Llama 70B Q8 + contexto 128k em mobilidade, sem nuvem. Veja a ficha do MacBook Pro M5 Max.
Mac de 128 GB vs. servidor com 2× H100 de 80 GB?
2× H100 = ~10× mais rápido em 70B (1700 GB/s por placa vs 546 GB/s de largura de banda unificada). Mas ~80 000 € + 1 kW vs Mac de 128 GB por ~5 000 € + 100 W. Para uso pessoal ou uma pequena equipe, o Mac leva ampla vantagem em €/GB.