Intermediário 11 minMacBook Pro

Qual LLM no MacBook Pro M2 Pro / Max (16–96 GB) ?

Resposta direta

Um MacBook Pro M2 Pro pode rodar modelos de 8 a 9B com conforto usando 16 GB e modelos de 24 a 32B com 32 GB; um M2 Max com 64 ou 96 GB é a única variação dessa geração que suporta um modelo de 70B em Q4 (cerca de 40 GB) e dois modelos de 20 a 30B ao mesmo tempo. A velocidade depende da largura de banda: 200 GB/s para o M2 Pro, 400 GB/s para o M2 Max, o que equivale a quase o dobro de tokens por segundo para o mesmo modelo.

Lançado em janeiro de 2023, o MacBook Pro M2 Pro / Max continua sendo um dos notebooks mais poderosos para a IA local: ventiladores, 400 GB/s de largura de banda no M2 Max e até 96 GB de memória unificada. Esta página explica o que cada configuração de memória permite, o que as medições publicadas indicam, por que dobrar a largura de banda não dobra a velocidade e em quais situações vale a pena passar para o M4 Max.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no macOS 14+
Hardware recomendado

Opção de compra para este guia: MacBook Pro M5 Pro — 24 GB / 1 TB.

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#MacBook Pro M2 Pro / Max em 2026: a ficha técnica útil

Na apresentação, a Apple anunciou para o M2 Pro uma largura de banda de 200 GB/s e até 32 GB de memória unificada, e para o M2 Max, 400 GB/s, até 96 GB e uma GPU com até 38 núcleos. A Apple apresentou esses 96 GB como uma ampliação dos limites da memória gráfica em um notebook. A memória é soldada ao processador, então a configuração é escolhida na compra e não muda mais.

Os chips do MacBook Pro de 14 e 16 polegadas (2023)
ChipLargura de bandaOpções de memóriaGPU
M2 Pro200 GB/s16 ou 32 GB16 ou 19 núcleos
M2 Max400 GB/s32, 64 ou 96 GB30 ou 38 núcleos

O resfriamento ativo é a segunda vantagem em comparação com um MacBook Air: o MacBook Pro consegue sustentar cargas prolongadas sem que o chip precise reduzir significativamente sua velocidade. A Apple também oferece, em alguns modelos, um modo de alta potência que permite que os ventiladores girem mais rápido; é uma configuração para experimentar durante gerações prolongadas, ao custo de mais ruído.

#M2 Pro ou M2 Max: o que a largura de banda realmente muda

O kit Mac

IA local no seu Mac, a fundo: memória unificada, MLX vs GGUF, o modelo certo para seu chip, Ollama e LM Studio ajustados para Apple Silicon.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

A geração de texto lê, em cada token, todos os pesos ativos do modelo. A velocidade máxima é, portanto, a largura de banda dividida pelo tamanho dos pesos. Um M2 Max com 400 GB/s pode, teoricamente, ser duas vezes mais rápido que um M2 Pro com 200 GB/s. As medições publicadas no repositório llama.cpp mostram que isso é verdade apenas parcialmente.

Geração de texto, Llama 7B, llama.cpp (discussão #4167)
Chip (núcleos de GPU)Largura de bandaQ4_0Q8_0F16
M2 Pro (19)200 GB/s38,86 t/s23,01 t/s13,06 t/s
M2 Max (30)400 GB/s60,99 t/s39,97 t/s24,16 t/s
M2 Max (38)400 GB/s65,95 t/s41,83 t/s24,65 t/s

Com um modelo de 7B em Q4_0, o M2 Max entrega apenas 1,6 a 1,7 vezes o desempenho do M2 Pro. Com o mesmo modelo em F16, de cerca de 13 GB, essa relação chega a quase 1,9. O cálculo explica isso: um modelo pequeno é lido tão rápido que outras limitações (cálculo, latência, sobrecarga) passam a predominar, enquanto um modelo grande realmente satura a memória. A consequência prática é contraintuitiva: quanto maior o modelo, mais o M2 Max justifica seu preço. Para um 7B, um M2 Pro é mais que suficiente.

→
Ordem de grandeza para o seu modelo
Divida a largura de banda pelo tamanho dos pesos em Q4 indicado no catálogo e depois desconte de 15 a 35%, dependendo do tamanho do modelo: o M2 Max atinge cerca de 63% do limite em um modelo 7B em Q4_0 e cerca de 83% em um 7B em F16. Para um modelo de 19 GB como Qwen3-Coder 30B-A3B, o limite do M2 Max já é de 21 t/s em leitura densa; os modelos MoE releem apenas seus parâmetros ativos, portanto, suas taxas reais de geração são muito maiores.

#De 16 a 96 GB: o que cabe, o que ainda fica apertado

Em máquinas com Apple Silicon, a GPU não tem acesso a toda a memória por padrão: segundo as discussões no repositório llama.cpp, o Metal disponibiliza entre dois terços e três quartos dela. Com 16 GB, conte com cerca de 10 a 12 GB para o modelo e seu contexto; com 96 GB, cerca de 64 a 72 GB. O limite pode ser aumentado por meio de um ajuste do sistema detalhado no guia dedicado, mas ultrapassá-lo pode travar a máquina.

Pesos em Q4 (catálogo QuelLLM) conforme a memória disponível, sem incluir a memória do contexto
ModeloPesos Q4M2 Pro 16 GBM2 Pro 32 GBM2 Max 64 GBM2 Max 96 GB
Qwen 3.5 9B6 GBConfortávelSimSimSim
Gemma 4 12B7 GBApenasSimSimSim
Mistral Small 3.2 24B14 GBNãoSimSimSim
Qwen 3.5 27B16 GBNãoSim, contexto moderadoSimSim
Qwen3-Coder 30B-A3B (MoE)19 GBNãoSim, contexto moderadoSimSim
Qwen 3.6 35B-A3B (MoE)21 GBNãoApenasSimSim
Llama 3.3 70B40 GBNãoNãoSim, contexto curtoSim

Modelos MoE como Qwen3-Coder 30B-A3B ou Qwen 3.6 35B-A3B ocupam 19 e 21 GB, mas ativam apenas cerca de 3 bilhões de parâmetros por token: com a mesma quantidade de memória, geram muito mais rápido do que um modelo denso de 27B. É a opção com o melhor custo-benefício em 32 GB. Em 96 GB, a vantagem do M2 Max está menos em carregar um único modelo muito grande e mais em manter dois modelos residentes na memória ao mesmo tempo, por exemplo, um modelo de chat e um modelo de código.

#Taxas publicadas: o que se pode afirmar e o que não se pode

Não temos medições próprias nessa máquina, e os tokens por segundo dependem do modelo, da quantização, do contexto e da versão do llama.cpp ou do Ollama. As únicas medições que citamos são as publicadas por usuários com um Llama 7B, que dão uma ideia da ordem de grandeza. Para um modelo mais recente, dividir a largura de banda pelo tamanho dos pesos continua sendo a abordagem adequada, com a margem de erro indicada acima.

O processamento do prompt segue outra lógica: a tabela do llama.cpp indica, para esse mesmo Llama 7B em F16, 384 t/s no processamento do prompt em um M2 Pro com 19 núcleos e 756 t/s em um M2 Max com 38 núcleos. O número de núcleos da GPU influencia essa fase, não a geração. Para um RAG ou a análise de um documento longo, o tempo de espera até a primeira palavra será, portanto, aproximadamente a metade em um M2 Max em comparação com um M2 Pro.

#Instalar Ollama e usá-lo corretamente no Mac

Ollama exige macOS Sonoma (14) ou mais recente. No Mac, a FAQ oficial esclarece que, quando Ollama é executado como aplicativo, suas variáveis de ambiente são definidas com launchctl e, em seguida, o aplicativo deve ser reiniciado. Os exports em um terminal não são suficientes: o aplicativo não os vê.

Configurações úteis para modelos grandes
launchctl setenv OLLAMA_FLASH_ATTENTION 1
launchctl setenv OLLAMA_KV_CACHE_TYPE q8_0
# puis quitter et relancer l'application Ollama

A FAQ do Ollama indica que o cache K/V quantizado em q8_0 utiliza aproximadamente metade da memória do formato f16 padrão e que é necessário ter o Flash Attention ativo para aproveitá-lo. Em um 70B com contexto longo, é esse ajuste que faz o cache caber na memória. Uma limitação a considerar: a quantização do cache pode degradar levemente a qualidade em alguns modelos; teste em seus casos antes de mantê-la.

!
Só aumente o limite de memória da GPU se souber o que está fazendo
O parâmetro iogpu.wired_limit_mb permite alocar mais memória para a GPU, mas não persiste após a reinicialização, e um excesso pode travar o macOS. Ele é descrito no guia de configurações do Apple Silicon, que continua sendo a referência; aplique-o apenas quando um modelo não couber na memória de outra forma e deixe pelo menos 8 GB para o sistema.

#Qual modelo para qual uso

Chat geral
Um modelo de 8 a 12B (Qwen 3.5 9B, Gemma 4 12B) responde rápido no M2 Pro; um modelo de 27B se torna interessante a partir de 32 GB para um francês mais bem elaborado.
Código
Um modelo MoE de código como Qwen3-Coder 30B-A3B em 32 GB ou mais, ou um modelo de agente de código de 24B como Devstral Small 2 (14 GB em Q4). Para autocompletar em linha, um modelo de 7B é suficiente.
RAG documental
Gemma 4 12B em velocidade, um modelo de 24B em qualidade de raciocínio; limite o contexto para não aumentar a espera até a primeira palavra.
Análise longa, agentes
Com 64 GB ou mais: Qwen 3.6 35B-A3B como MoE rápido, ou um modelo de 70B para priorizar a qualidade, desde que você aceite cerca de 10 t/s na melhor das hipóteses (400 ÷ 40).

Um ponto de atenção com modelos de raciocínio: eles geram blocos longos de reflexão antes da resposta, o que multiplica a quantidade de tokens a serem gerados. Em uma máquina de 60 t/s, dez mil tokens de reflexão levam quase três minutos. Para perguntas simples, desative o modo de reflexão quando o modelo permitir.

#Na bateria, sob carga prolongada: o que muda

O MacBook Pro foi projetado para sustentar o desempenho por mais tempo que um Air, mas continua sendo um notebook. Dois ajustes influenciam as taxas de processamento: o modo de alimentação (quando funciona com bateria, o macOS pode limitar a potência) e, nos modelos que o oferecem, o modo de alta potência. Segundo a Apple, esse modo permite que as ventoinhas girem mais rápido para manter um desempenho melhor em cargas muito intensas, com mais ruído. Para uma geração de vários minutos, conecte o notebook à fonte de alimentação e experimente esse modo.

#Você precisa passar para um M4 Max?

O M4 Max atinge 546 GB/s e 128 GB de memória, de acordo com a Apple. Na tabela do llama.cpp, um Llama 7B em Q4_0 passa de 65,95 t/s no M2 Max com 38 núcleos para 83,06 t/s no M4 Max com 40 núcleos: cerca de 26% a mais. O ganho é real para uso intenso, mas o M2 Max de 96 GB mantém uma vantagem de capacidade em relação a um M4 Pro, limitado a 64 GB.

Quando manter o M2 Max e quando mudar
SituaçãoRecomendação
Você usa principalmente modelos de 8–14BUm M2 Pro de 32 GB é suficiente; não pague por largura de banda extra
Você carrega modelos de 27 a 35B todos os diasM2 Max com 64 ou 96 GB: é nessa faixa que ele se justifica
Você quer rodar um 70B com folga ou manter dois modelos carregados na memóriaM2 Max 96 GB, ou M4 Max 128 GB se a velocidade for importante
Você procura um servidor sem telaUm Mac mini M4 Pro ou um Mac Studio é mais adequado

#Perguntas frequentes

FAQ
Um MacBook Pro M2 Pro de 16 GB é suficiente para IA local?+
Sim, para modelos de 8 a 9 bilhões de parâmetros em Q4, que ocupam de 5 a 6 GB, com um contexto razoável. Não é adequado para modelos de 24B ou mais. Como não é possível adicionar memória posteriormente, escolha 32 GB se quiser poder migrar um dia para um modelo maior.
Qual a diferença entre GPU M2 Max com 30 e 38 núcleos?+
Ambos têm 400 GB/s de largura de banda. Nas medições do llama.cpp, a geração de texto é apenas cerca de 8% mais rápida com 38 núcleos (65,95 contra 60,99 t/s em Q4_0), pois depende da largura de banda. A diferença é mais evidente no processamento do prompt, onde a versão com 38 núcleos é claramente mais rápida.
É possível rodar dois LLM em paralelo em um M2 Max 64 GB?+
Sim, se a soma dos pesos e dos contextos permanecer dentro da parcela de memória que o Metal aloca ao GPU, ou seja, aproximadamente entre 43 e 48 GB. Por exemplo, um modelo de 27B (16 GB) e um modelo de 12B (7 GB) cabem. Ollama mantém os modelos na memória por 5 minutos por padrão, e um recarregamento leva alguns segundos.
Qual modelo para francês em um MacBook Pro M2 Max?+
Mistral Small 3.2 24B, do laboratório francês Mistral AI, é um bom candidato em máquinas com 32 GB ou mais (14 GB em Q4). O Qwen 3.5 9B e a Gemma 4 12B são multilingues e mais rápidos. Teste-os com seus próprios textos: a qualidade em francês depende do tipo de tarefa.
O M2 Max aquece mais que o M1 Max em inferência?+
Não temos uma comparação numérica confiável para citar. Os dois têm refrigeração ativa; a velocidade depende principalmente da largura de banda, igual nos dois: 400 GB/s. Para gerações longas, conecte a alimentação e experimente o modo Alta potência oferecido pela Apple, aceitando o ruído dos ventiladores.
É necessário instalar o MLX junto com o Ollama em um M2 Max?+
Não necessariamente. O Ollama é suficiente para bate-papo, RAG e API. O MLX interessa a desenvolvedores que querem controlar o modelo via Python ou testar um ajuste LoRA local. As diferenças de velocidade variam conforme o modelo e a versão: a comparação detalhada do site as analisa sem prometer um ganho fixo.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.