Mac M4 Max e LLM local: MLX, desempenho, modelos
O MacBook Pro M4 Max (64 ou 128 GB de RAM unificada) tornou-se a máquina portátil mais capaz para rodar um LLM local. A combinação de memória unificada + framework MLX da Apple permite carregar os maiores modelos de pesos abertos do momento — os MoE de 30–35B em precisão total, os modelos densos multimodais de 27B — em um laptop, a velocidades surpreendentes. Este guia mede o que realmente funciona: MLX vs Ollama, modelos viáveis na prática, tokens/segundo medidos e comportamento térmico ao funcionar com bateria.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Opção de compra para este guia: BOSGAME M5 128GB / 2TB (Ryzen AI Max+ 395).
Por que essa escolha? Nossa ficha completa sobre BOSGAME M5 128GB / 2TB (Ryzen AI Max+ 395) →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#Por que o M4 Max muda o jogo para LLMs locais
Em um PC com Windows ou Linux, a VRAM da GPU é a principal limitação. Uma RTX 4090 tem um limite de 24 GB: rodar localmente um modelo de 30-35B em FP16 exige offload para a CPU, o que divide a taxa de geração por cinco ou dez. O M4 Max aborda o problema pelo caminho inverso. A GPU e a CPU compartilham a mesma memória: tudo o que está na RAM fica acessível à GPU sem cópia.
Na prática, um MacBook Pro M4 Max de 128 GB pode carregar os melhores modelos MoE de 2026 — Qwen 3.6 35B-A3B ou Qwen 3.8 27B — em precisão plena FP16, ou vários modelos ao mesmo tempo, sem problemas, e continuar executando-os na bateria. Nenhuma máquina portátil x86 consegue isso hoje — é necessário um desktop com uma RTX 5090 ou duas RTX 3090 para se aproximar do mesmo resultado, e ainda assim sem a possibilidade de uso em movimento.
#RAM unificada: por que 128 GB ≠ 128 GB de VRAM
Você viu o que um M4 Max consegue fazer com MLX. O kit Mac detalha quando MLX realmente supera GGUF (cap. 3), como calcular seu orçamento de memória em contextos longos (cap. 5) e que desempenho esperar, incluindo calor e bateria (cap. 6).
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
O macOS não permite que um único processo consuma toda a memória. Por padrão, a GPU pode usar cerca de 75% da RAM total. Em uma máquina de 128 GB, isso dá cerca de 96 GB disponíveis para seus modelos. Em uma de 64 GB, você obtém cerca de 48 GB. Isso é mais que suficiente para os modelos-alvo, mas é preciso saber disso antes de calcular.
- Mac M4 Max 64 GB
- Aproximadamente 48 GB para o LLM. Os melhores MoE de 2026 em Q8 rodam com folga — Qwen3-Coder 30B-A3B (≈32 GB), Qwen 3.8 27B (≈30 GB), Qwen 3.6 35B-A3B (≈40 GB), que cabe no limite — e o Mistral Small 24B cabe até mesmo em FP16 (≈48 GB).
- Mac M4 Max 128 GB
- Cerca de 96 GB para o LLM. Sobra espaço para executar os MoE grandes em precisão total FP16 (Qwen 3.6 35B-A3B, Qwen 3.8 27B, Granite 4.2 30B), manter vários modelos carregados em paralelo ou aumentar o contexto para 256k tokens.
- Quantizações recomendadas
- Q4_K_M continua sendo uma boa opção padrão. Com 128 GB, você pode passar para Q5_K_M ou Q6 sem problemas para melhorar a qualidade.
#MLX vs Ollama: qual escolher para um Mac M4 Max?
A Apple lançou o MLX em dezembro de 2023: um framework de computação com arrays pensado para Apple Silicon, funcionalmente equivalente ao PyTorch, mas projetado em torno da memória unificada. O módulo mlx-lm fornece uma CLI e uma API Python para executar modelos quantizados no formato MLX (próximo ao GGUF, mas distinto).
- Ollama (Metal)
- Mais fácil de instalar, ecossistema enorme, formatos GGUF universais, API compatível com a OpenAI na porta 11434. Pequena sobrecarga, conversão de memória CPU↔GPU não ideal.
- MLX (mlx-lm)
- Mais rápido na prática em Apple Silicon: +20 a +40% de tokens por segundo em modelos de 30B+, gerenciamento nativo de memória, cache de prompts integrado. Ecossistema menor, sem API REST padronizada de fábrica.
- Veredito
- Para explorar e testar 10 modelos: Ollama. Para aproveitar ao máximo o M4 Max e rodar os grandes MoE de 30-35B em precisão plena em produção local: MLX.
#Instalar o MLX e executar um primeiro modelo
- 01Preparar um ambiente PythonUse Python 3.10+ (3.12 recomendado). No Mac, o mais adequado é uv ou pyenv. O mlx-lm não tem outros pré-requisitos nativos além de Apple Silicon.
- 02Instalar mlx-lmUm único comando pip é suficiente. Tudo é compilado para arm64 Metal.
- 03Iniciar um modelo MLXA CLI mlx_lm.generate baixa o modelo do Hugging Face (organização mlx-community) e o executa.
- 04Expor uma API HTTP (opcional)Desde a versão 0.18, o mlx-lm integra um comando mlx_lm.server que expõe uma API compatível com a OpenAI na porta 8080.
#Modelos testados em MacBook Pro M4 Max de 128 GB
Todos os números abaixo são medidos em um MacBook Pro de 16" com M4 Max (40 núcleos de GPU, 128 GB), conectado à tomada, primeiro a frio e depois após 5 minutos de aquecimento. Prompt curto (50 tokens), geração de 500 tokens, tamanho do lote de 1.
- Qwen 3.6 35B-A3B Q8 (MLX)
- ≈40 GB na RAM. 42-50 tokens/s: o MoE ativa apenas 3B de parâmetros, o que explica a alta taxa de processamento apesar do tamanho. Uma escolha confiável e versátil para este Mac.
- Qwen 3.8 27B Q8 (MLX)
- ≈30 GB de RAM. 18-22 tokens/s (modelo denso). Contexto de 262k e visão, o mais próximo de um Copilot local. Lembre-se de definir o ajuste de raciocínio como low, caso contrário ele pensa demais.
- Qwen3-Coder 30B-A3B Q8 (MLX)
- ≈32 GB de RAM. 44-52 tokens/s. MoE especializado em código, contexto de 256k: ideal como assistente de desenvolvimento local.
- GLM 4.7 Flash Q8 (MLX)
- ≈32 GB de RAM (MoE 30B-A3B, licença MIT). 40-48 tokens/s. Excelente para agentes e chamadas de ferramentas, responde muito rápido.
- Granite 4.2 30B Q8 (MLX)
- ≈33 GB de RAM. 30-38 tokens/s. Voltado ao uso profissional ou empresarial, econômico em tokens e estável em sessões longas.
- Mistral Small 24B FP16 (MLX)
- ≈48 GB. 18-22 tokens/s. Modelo denso, excelente qualidade em francês, especialmente bom para síntese documental.
#Benchmarks detalhados: MLX vs Ollama vs llama.cpp
Com o mesmo modelo Qwen 3.8 27B em Q8, veja a dispersão observada entre os três runtimes na mesma máquina M4 Max de 128 GB:
- MLX de 8 bits (mlx-community)
- 20,5 tokens/s em média, avaliação do prompt ~410 tokens/s.
- Ollama Q8_0 (Metal)
- 15.2 tokens/s em média, avaliação do prompt ~300 tokens/s.
- llama.cpp puro Q8_0
- 15.6 tokens/s em média. Ollama adiciona pouca sobrecarga em comparação com o llama.cpp.
#M4 Max vs RTX 4090: quem ganha em quê
Uma comparação direta: um MacBook Pro M4 Max de 128 GB (modelo substituído pelo M5 Max na Apple — procurar usado, preço variável) frente a um desktop equipado com uma RTX 4090 de 24 GB usada (preço variável, apenas a GPU, sem o restante do computador).
- Modelos pequenos ≤14B Q4 (Qwen 3.5 9B, gpt-oss 20B)
- A RTX 4090 leva uma vantagem clara (80-120 tok/s contra 35-60 no M4 Max). Para modelos desses tamanhos, escolha a 4090 se tiver essa opção.
- Modelos densos de 24–30B Q4 (Mistral Small, Qwen 3.8 27B)
- A RTX 4090 ainda está à frente (30-40 tok/s contra 18-22 no M4 Max), mas a diferença diminui.
- Precisão total Q8/FP16
- O M4 Max leva vantagem na prática: executa os melhores modelos MoE de 2026 (35B-A3B, 27B) em Q8 ou FP16 na sua RAM, enquanto a RTX 4090 precisa recorrer a Q4 ou transferir parte da execução para a CPU (taxa de geração dividida por cinco).
- MoE de grande porte (Qwen 3.6 35B-A3B)
- O M4 Max é excelente graças à grande quantidade de RAM: tudo cabe na memória, mesmo em FP16. A RTX 4090 precisa transferir parte do modelo para a RAM do sistema assim que se passa de Q4.
- Mobilidade
- Não há comparação: o M4 Max aguenta ~3 h de inferência contínua na bateria, enquanto a RTX 4090 tem autonomia de 0 km.
#Comportamento térmico, ventoinhas e autonomia da bateria
O M4 Max aquece pouco durante a inferência em comparação com uma GPU NVIDIA. Sob carga contínua (geração de 5 minutos com um grande MoE 35B em Q8), as ventoinhas chegam a cerca de 2.800 RPM — audíveis, mas longe do nível de ruído de um PC gamer. A temperatura da CPU/GPU se estabiliza em torno de 95 °C, sem redução significativa de desempenho por aquecimento quando conectado à tomada.
- Conectado à tomada (carregador de 140 W)
- Potência total, taxa de processamento máxima. Sem limitações, ventoinhas em rotação moderada.
- Usando a bateria
- O macOS reduz ligeiramente a frequência da GPU: cerca de 80% da taxa de geração obtida com o computador ligado à tomada. Qwen 3.6 35B-A3B passa de cerca de 45 para 37 tokens/s.
- Autonomia da bateria durante a inferência
- MacBook Pro de 16" M4 Max, 100 Wh: ~3 h de inferência contínua em um MoE grande de 35B, ~5 h em modelos de 7B a 14B, ~8 h de uso misto de chat + leitura.
- Ruído das ventoinhas
- Audíveis a partir de 30 segundos de geração contínua, mas bem mais discretos que um laptop PC RTX.
#Dicas para tirar o máximo do M4 Max
- Mantenha o modelo carregado
- O primeiro prompt após o carregamento é lento. Use o modo servidor (mlx_lm.server ou ollama serve) para manter o modelo na RAM durante toda a sessão.
- Prefira o formato MLX
- Os modelos publicados pela mlx-community no Hugging Face são otimizados para Apple Silicon. Procure o prefixo "mlx-community/" antes de qualquer outra coisa.
- Monitore com o asitop ou o Stats
- asitop (equivalente ao nvtop para Apple Silicon) mostra em tempo real o uso da GPU, a memória e a potência instantânea.
- Modo de alto desempenho
- Em Ajustes do Sistema → Bateria → escolher « Alto desempenho ». Ganho marginal, mas real, nos modelos de 70B.
- Desative o Spotlight durante os benchmarks
- A indexação do Spotlight pode reduzir a taxa de processamento em 5 a 10 %. mdutil -a -i off desativa essa indexação durante uma sessão.
#Para se aprofundar
Três caminhos para aprofundar o tema:
- Instalar Ollama no macOS
- Se você prioriza a simplicidade em relação ao desempenho puro, o guia "Instalar Ollama no macOS (Apple Silicon)" cobre todas as ferramentas Metal usadas pelo Ollama.
- Escolher sua quantização
- Com 128 GB de RAM unificada, você tem margem para passar para Q5_K_M, Q6 ou até FP16 — o guia "Escolher a quantização" detalha as vantagens e desvantagens.
- Mac Studio Ultra para ir mais longe
- Se os modelos MoE de 30 a 35B não forem suficientes para você e você quiser executar os maiores modelos open-weight (de 100B a 671B) localmente, o guia "Qual LLM no Mac Studio" abrange as configurações Ultra com até 512 GB.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.