Intermediário 11 minMacBook Pro

Qual LLM no MacBook Pro M1 Pro / Max (16–64 GB) ?

Lançado no final de 2021, o MacBook Pro M1 Pro / Max continua sendo, em 2026, uma máquina notável para IA local, especialmente na versão Max de 64 GB. Largura de banda de 200 a 400 GB/s, ventiladores ativos (sem redução de desempenho por aquecimento), até 64 GB de memória unificada: um MoE Qwen 3.6 35B roda a aproximadamente 34 tokens por segundo e um modelo de 30B cabe em Q8 com qualidade plena, algo impossível em um notebook equivalente voltado ao público geral. Este guia detalha como aproveitar essa máquina hoje.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-08-27·Testado no macOS 14+
Hardware recomendado

Opção de compra para este guia: MacBook Pro M5 Pro — 24 GB / 1 TB.

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#MBP M1 Pro / Max em 2026

Data de lançamento
Outubro de 2021. Ainda suportado por macOS Sequoia (15) em 2026.
M1 Pro
8 ou 10 núcleos de CPU + 14 ou 16 núcleos de GPU, largura de banda de 200 GB/s, RAM de 16 ou 32 GB.
M1 Max
10 núcleos de CPU + 24 ou 32 núcleos de GPU, largura de banda de 400 GB/s, RAM de 32 ou 64 GB.
Refrigeração
Ventoinhas ativas — sem redução de desempenho durante o uso de LLM. Pode funcionar continuamente por 24 horas.
Valor no mercado de usados em 2026
MBP M1 Pro e M1 Max: de segunda mão, preço variável conforme o estado de conservação.
→
Por que é um bom negócio em 2026
Um MBP M1 Max de 64 GB usado (preço variável) roda os melhores modelos MoE de 2026 (Qwen 3.6 35B, Qwen3-Coder 30B) em Q8 com qualidade plena. Para ter a mesma capacidade de execução de LLMs em um PC, são necessárias 2 × RTX 3090 (usadas, preço variável) + um conjunto de CPU, placa-mãe e fonte de alimentação compatíveis (~800 €), o que representa um custo total considerável e um sistema barulhento e com alto consumo de energia.

#1. M1 Pro vs M1 Max: escolher

M1 Pro (200 GB/s)
Excelente para modelos de 8 a 12B. Um MoE de 30 a 35B (Qwen 3.6 35B-A3B) cabe na versão de 32 GB, mas não na de 16 GB.
M1 Max (400 GB/s)
2× a largura de banda = 2× a velocidade de inferência em modelos ≥ 13B. Essencial para rodar um 30B em Q8 com qualidade plena.
Núcleos GPU
M1 Max 32-core é 15-20% mais rápido que o 24-core em modelos de 8B. A diferença aumenta nos modelos de 27-35B.

#2. 16, 32, 64 GB: quais modelos

Modelos recomendados por configuração do MBP M1
ModeloQuantRAM do modeloM1 Pro 16 GBM1 Pro 32 GBM1 Max 64 GB
Qwen 3.5 9BQ5_K_M7 GB283143
Granite 4.2 8BQ5_K_M6 GB303447
Gemma 4 12BQ5_K_M9 GB182130
Qwen 3.8 27BQ4_K_M18 GB—1118
Mistral Small 24BQ5_K_M16 GB—1018
Qwen 3.6 35B-A3B (MoE)Q4_K_M23 GB—2234
Qwen3-Coder 30B-A3BQ8_032 GB——24

#3. Benchmarks de tokens por segundo

MBP M1 Max com GPU de 32 núcleos, 64 GB, Ollama, conectado à tomada — ordens de grandeza
ModeloQ4_K_MQ5_K_MQ8_0
Qwen 3.5 9B46 t/s43 t/s28 t/s
Granite 4.2 8B50 t/s47 t/s30 t/s
Gemma 4 12B32 t/s30 t/s19 t/s
Qwen 3.8 27B18 t/s16 t/s10 t/s
Qwen 3.6 35B-A3B34 t/s—22 t/s

#4. Instalação e configuração

Terminal — setup completo
# Homebrew
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

# Ollama + démarrage auto
brew install --cask ollama
brew services start ollama

# Modèles conseillés
ollama run qwen3.5:9b        # M1 Pro 16 Go
ollama run qwen3.8:27b       # M1 Pro 32 Go
ollama run qwen3.6:35b       # M1 Max 64 Go (MoE 35B)

#5. Aumentar o limite de memória da GPU

No MBP M1 Max 64 GB, o macOS aloca por padrão ~43 GB para o GPU. Para carregar um modelo de 30-35B em Q8 (~35 GB) com um contexto ampliado — o cache KV de um contexto de 256k pode, sozinho, ultrapassar 10 GB — o total ultrapassa rapidamente os 43 GB, e é necessário aumentar o limite.

O kit Mac

O seu MacBook Pro M1 pode rodar mais do que você imagina. O kit Mac mostra como ampliar o limite de memória da GPU (cap. 2), escolher o modelo adequado para o seu chip (cap. 4) e corrigir o que dá problema: Metal, memória, swap (cap. 14).

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias
Aumentar a memória da GPU que pode ser alocada
# Vérifier la valeur actuelle
sysctl iogpu.wired_limit_mb

# Relever à 56 Go (64 Go - 8 Go système)
sudo sysctl iogpu.wired_limit_mb=57344

# Rendre permanent
echo "iogpu.wired_limit_mb=57344" | sudo tee -a /etc/sysctl.conf
!
Deixe ≥ 8 GB para macOS
Abaixo disso, o sistema passa a usar swap e a inferência fica drasticamente mais lenta. 8 GB é a margem mínima em um MBP de 64 GB; fique em 6 GB somente se fechar todos os apps Electron e não usar navegador.

#6. Executar um modelo grande de 2026 no M1 Max

O MBP M1 Max de 64 GB executa os maiores modelos de 2026 com qualidade plena: um MoE de 30-35B em Q8 ou vários modelos carregados em paralelo. A seguir, a configuração ideal:

MoE Qwen 3.6 35B no M1 Max 64 GB
# Augmenter la RAM GPU (fait une seule fois)
sudo sysctl iogpu.wired_limit_mb=57344

# Activer flash attention + KV cache quantifié
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
brew services restart ollama

# Lancer le modèle
ollama run qwen3.6:35b
# Comptez ~34 tokens/seconde (MoE, 3B actifs) — contexte étendu confortable
i
Autonomia da bateria ao executar modelos grandes
Cerca de 1h30 de autonomia em chat contínuo com um MoE 35B (consumo ~40 W). Para sessões longas, conecte o computador à tomada — o MBP M1 Max limita fortemente a GPU quando a bateria está baixa.

#Atualização para M3 Max ou M4 Max?

M3 Max 16-core (2023)
50% mais velocidade bruta em relação ao M1 Max. Possibilidade de 128 GB de RAM (contra 64 GB). Justifica o upgrade se você quiser fazer um MoE de 30–35B ultrapassar 50 tok/s.
M4 Max 16-core (2024)
+90% em relação ao M1 Max, banda passante de 546 GB/s. 128 GB de RAM. Melhor laptop Mac para LLM em 2026.
Permanecer no M1 Max 64 GB
Plenamente viável: MoE 35B a ~34 tok/s, 27B denso a 18 tok/s. Não há motivo para atualizar antes de 2027 se a velocidade atual estiver satisfatória.

#Perguntas frequentes

MBP M1 Pro 16 GB ou M1 Max 32 GB para IA local?+
O M1 Max de 32 GB para um ganho real: o dobro da largura de banda (400 vs 200 GB/s) = o dobro da velocidade em modelos 13B+, e mais 20 GB utilizáveis. Por outro lado, para rodar apenas modelos de 8–9B, o M1 Pro de 16 GB é suficiente com folga.
É possível rodar um modelo grande no MBP M1 Max com 32 GB?+
Sim: um modelo MoE 30-35B em Q4 (~23 GB, como o Qwen 3.6 35B-A3B) cabe em 32 GB e roda rápido devido aos 3B de parâmetros ativos. Por outro lado, um modelo 30B em Q8 (~32 GB) ou um modelo denso ≥ 27B em Q8 saturam os 32 GB: nesse caso, passe para 64 GB.
O MBP M1 Pro é melhor que um PC com RTX 3060 para LLMs?+
Para Qwen 3.5 9B Q4: velocidade comparável (30-45 tok/s). Vantagem Mac: 16 GB disponíveis versus 12 GB de VRAM, silêncio, sem drivers. Vantagem PC: ecossistema CUDA, fine-tuning mais simples.
Os ventiladores ficam muito barulhentos durante a inferência de LLM?+
Audível ao usar um modelo grande em chat contínuo (RPM ~4000, equivalente a um MacBook Pro Intel 2019 durante uma compilação). Silencioso com modelos de 8-12B (RPM ~2500). Muito menos barulhento que um notebook gamer com a mesma carga de GPU.
Para LLMs, escolher a tela de 16" ou de 14"?+
Nenhum impacto no desempenho. O modelo de 16" tem melhor dissipação térmica (chassi maior), portanto sustenta a carga por um pouco mais de tempo. 14" se a portabilidade for prioridade, 16" se as sessões longas forem mais importantes.
Ollama ou MLX no MBP M1 Max?+
O Ollama continua sendo a base para 95% dos usos (simples, robusto, API OpenAI). O MLX é interessante para fazer o ajuste fino de um modelo de 8–9B localmente ou para modelos nativos de MLX que aproveitam o M1 Max. Os dois coexistem sem conflito.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.