Início › Catálogo › Melhor LLM para um Mac com 128 GB de memória unificada em 2026

Melhor LLM para um Mac com 128 GB de memória unificada em 2026

◆ Mac — IA local no seu Mac, ao máximo — memória unificada, MLX, o modelo certo para seu chip · 24 € · ou todos os kits 49 € →

Classificação atualizada em 09/10/2026

128 GB de memória unificada é o patamar premium das estações de trabalho para IA — e já não se limita aos computadores de mesa: o MacBook Pro de 14 ou 16 polegadas chega a esse patamar tanto com o M5 Max quanto com o M4 Max, desde que você escolha a variante com GPU de 40 núcleos (614 GB/s no M5 Max, contra 460 GB/s na variante de 32 núcleos). Llama 70B em Q8 (~75 GB), MoE 150B em Q4, contexto de 200k para RAG empresarial.

Ofertas e alternativas para IA local

Compare os preços de MacBook Pro M5 Pro — 24 GB / 1 TB em nossos lojistas parceiros (fichas de produto verificadas):

Qual PC escolher conforme seu orçamento? Nossas escolhas de 800 a 3 500 € →

Links afiliados — QualLLM pode receber uma comissão sobre as compras, sem custo adicional para você, o que não influencia a classificação (estabelecida de forma independente). Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

Classificação

1

🇺🇸 Laguna XS.2

Poolside · 33B de parâmetros · Apache 2.0 · 131 072 tokens ctx

MoE de 33B/3B ativos, com licença Apache 2.0, especializado em programação agêntica. 68,2% no SWE-Bench Verified, 128k de contexto. Roda em um Mac com 36 GB. Lançamento em 28 de abril de 2026.

Por que esta posição MoE de 33B/3B ativos, com licença Apache 2.0, especializado em programação agêntica. 68,2% no SWE-Bench Verified, 128k de contexto. Roda em um Mac com 36 GB. Lançamento em 28 de abril de 2026.
ollama run laguna-xs.2
No Apple M5 Max (128 GB)
FP16
66 GB · 100 tok/s
2

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31B de parâmetros · MIT · 128 000 tokens ctx

GLM-4.7-Flash (MoE 31B, ~3B ativos): a melhor relação entre desempenho em programação e VRAM da classe 30B. MIT, 128k ctx, muito rápido em 3090/4090.

Por que esta posição GLM-4.7-Flash (MoE 31B, ~3B ativos): a melhor relação entre desempenho em programação e VRAM da classe 30B. MIT, 128k ctx, muito rápido em 3090/4090.
ollama run glm-4.7-flash
No Apple M5 Max (128 GB)
FP16
62 GB · 100 tok/s
3

🇺🇸 Granite 4.0 H-Small 32B-A9B

IBM · 32 bilhões de parâmetros · Apache 2.0 · 128 000 tokens ctx

Híbrido Mamba-2 + MoE 32B/9B ativos. ~70% menos RAM com contextos longos. Apache 2.0.

Por que esta posição Híbrido Mamba-2 + MoE 32B/9B ativos. ~70% menos RAM com contextos longos. Apache 2.0.
ollama run granite4:small-h
No Apple M5 Max (128 GB)
FP16
64 GB · 75 tok/s
4

🇨🇳 Qwen 3.6 35B-A3B

Alibaba · 35B parâmetros · Apache 2.0 · 262 000 tokens ctx

MoE 35B/3B ativos para programação com agentes. 73,4% no SWE-Bench. Lançamento em 16 de abril de 2026.

Por que esta posição MoE 35B/3B ativos para programação com agentes. 73,4% no SWE-Bench. Lançamento em 16 de abril de 2026.
ollama run qwen3.6:35b-a3b
No Apple M5 Max (128 GB)
FP16
70 GB · 60 tok/s
5

🇨🇳 Qwen 3 30B-A3B

Alibaba · 30B de parâmetros · Apache 2.0 · 131 072 tokens ctx

MoE 30B/3B ativos, raciocínio híbrido. MMLU 81.4, AIME24 80.4. 100+ idiomas.

Por que esta posição MoE 30B/3B ativos, raciocínio híbrido. MMLU 81.4, AIME24 80.4. 100+ idiomas.
ollama run qwen3:30b-a3b
No Apple M5 Max (128 GB)
FP16
62 GB · 100 tok/s
6

🇺🇸 Nemotron Cascade 2 30B-A3B

NVIDIA · 30B de parâmetros · NVIDIA Open Model License · 128 000 tokens ctx

MoE 30B/3B ativos: thinking mode + instruct. Medalha de ouro na IMO 2025 e na IOI 2025. Inferência rápida graças aos 3B ativos, capacidades de raciocínio de nível 30B. Lançamento em abril de 2026.

Por que esta posição MoE 30B/3B ativos: thinking mode + instruct. Medalha de ouro na IMO 2025 e na IOI 2025. Inferência rápida graças aos 3B ativos, capacidades de raciocínio de nível 30B. Lançamento em abril de 2026.
ollama run nemotron-cascade-2
No Apple M5 Max (128 GB)
FP16
60 GB · 80 tok/s
7

🇨🇳 Qwen3-Coder 30B-A3B

Alibaba · 30B de parâmetros · Apache 2.0 · 262 144 tokens ctx

MoE de 30B (3,3B ativos), especializado em programação agêntica. Muito rápido ao rodar localmente, 256k de contexto nativo, a referência para 16–24 GB via Ollama.

Por que esta posição MoE de 30B (3,3B ativos), especializado em programação agêntica. Muito rápido ao rodar localmente, 256k de contexto nativo, a referência para 16–24 GB via Ollama.
ollama run qwen3-coder:30b
No Apple M5 Max (128 GB)
FP16
61 GB · 100 tok/s
8

🇨🇳 Qwen 3 VL 30B-A3B

Alibaba · 30B de parâmetros · Apache 2.0 · 262 144 tokens ctx

Visão MoE 30B/3B ativos. Ponto de equilíbrio ideal para visão no Qwen 3. 256k ctx.

Por que esta posição Visão MoE 30B/3B ativos. Ponto de equilíbrio ideal para visão no Qwen 3. 256k ctx.
ollama run qwen3-vl:30b
No Apple M5 Max (128 GB)
FP16
62 GB · 100 tok/s

Tabela comparativa

Posição Modelo Params VRAM Q4 Contexto Licença No Apple M5 Max (128 GB)
#1 Laguna XS.2 33B 19 GB 131 072 Apache 2.0 100 tok/s · FP16
#2 GLM 4.7 Flash 31B 19 GB 128 000 MIT 100 tok/s · FP16
#3 Granite 4.0 H-Small 32B-A9B 32B 19 GB 128 000 Apache 2.0 75 tok/s · FP16
#4 Qwen 3.6 35B-A3B 35B 21 GB 262 000 Apache 2.0 60 tok/s · FP16
#5 Qwen 3 30B-A3B 30B 19 GB 131 072 Apache 2.0 100 tok/s · FP16
#6 Nemotron Cascade 2 30B-A3B 30B 17 GB 128 000 NVIDIA Open Model License 80 tok/s · FP16
#7 Qwen3-Coder 30B-A3B 30B 19 GB 262 144 Apache 2.0 100 tok/s · FP16
#8 Qwen 3 VL 30B-A3B 30B 19 GB 262 144 Apache 2.0 100 tok/s · FP16
O kit Mac

IA local no seu Mac, a fundo: memória unificada, MLX vs GGUF, o modelo certo para seu chip, Ollama e LM Studio ajustados para Apple Silicon.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Memo gratuito

Qual modelo de código rodar na SUA máquina?

Receba o resumo VRAM → melhor modelo de código → comando Ollama (uma única tela, copiar e colar). E passe para o kit Copiloto Local para transformar isso em uma configuração que realmente funciona.

O kit Copiloto Local — as configs Ollama + Cline + Aider prontas para colar, Modelfiles ajustados, solução de problemas, espaço online vitalício →

Sem spam. Cancelamento em 1 clique. Seus dados ficam conosco (nunca revendidos).

Metodologia do ranking

Filtro: modelos de 30 a 250B cuja versão Q4_K_M ocupa menos de 96 GB (deixa 32 GB para o macOS + contexto massivo). Bônus para modelos de 70 a 150B (pico de 128 GB) e MoE até 250B.

Critérios considerados:

  • Q4_K_M ≤ 96 GB
  • 70B Q8 com folga
  • MoE 150B+ acessível
  • Contexto 200k estável

A pontuação é totalmente transparente: consulte nossa metodologia para os detalhes de cálculo de VRAM/tokens/seg.

Perguntas frequentes

Mac 128 GB: Llama 70B Q8 ou 123B Q5?

Llama 70B Q8 (~75 GB) a 10-14 tokens/s no M4 Max. Mistral Large 123B Q5 (~85 GB) a 8-12 tokens/s. O Q8 em 70B é geralmente mais útil (quase equivalente a FP16, ligeiramente melhor que Q6 em outros casos). O 123B continua sendo mais capaz no geral.

MoE de fronteira com 128 GB: viável?

DeepSeek V4 Flash 284B (13B ativos MoE) Q3_K_M (~140 GB) não cabe — é necessário um Mac Studio com 192 GB ou mais. Granite 4 Mamba 150B Q4 (~80 GB) cabe. Para modelos de fronteira com 200B+, passe para Mac Studio Ultra.

MacBook Pro M5 Max 128 GB: realmente 128 GB em um notebook?

Sim, e é o único notebook do mercado nesse nível. O MacBook Pro 14 e 16 polegadas atinge 128 GB de memória unificada no M5 Max como no M4 Max, mas apenas na versão com GPU de 40 núcleos — no M5 Max, a única com 614 GB/s (460 GB/s na versão com 32 núcleos). Llama 70B Q8 + contexto 128k em mobilidade, sem nuvem. Veja a ficha do MacBook Pro M5 Max.

Mac de 128 GB vs. servidor com 2× H100 de 80 GB?

2× H100 = ~10× mais rápido em 70B (1700 GB/s por placa vs 546 GB/s de largura de banda unificada). Mas ~80 000 € + 1 kW vs Mac de 128 GB por ~5 000 € + 100 W. Para uso pessoal ou uma pequena equipe, o Mac leva ampla vantagem em €/GB.

Para se aprofundar

Os kits QuelLLM O guia de referência por uso
Todos os kits com acesso vitalício — 49 €