Qual LLM no MacBook Pro M2 Pro / Max (16–96 GB) ?
Um MacBook Pro M2 Pro pode rodar modelos de 8 a 9B com conforto usando 16 GB e modelos de 24 a 32B com 32 GB; um M2 Max com 64 ou 96 GB é a única variação dessa geração que suporta um modelo de 70B em Q4 (cerca de 40 GB) e dois modelos de 20 a 30B ao mesmo tempo. A velocidade depende da largura de banda: 200 GB/s para o M2 Pro, 400 GB/s para o M2 Max, o que equivale a quase o dobro de tokens por segundo para o mesmo modelo.
Lançado em janeiro de 2023, o MacBook Pro M2 Pro / Max continua sendo um dos notebooks mais poderosos para a IA local: ventiladores, 400 GB/s de largura de banda no M2 Max e até 96 GB de memória unificada. Esta página explica o que cada configuração de memória permite, o que as medições publicadas indicam, por que dobrar a largura de banda não dobra a velocidade e em quais situações vale a pena passar para o M4 Max.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Opção de compra para este guia: MacBook Pro M5 Pro — 24 GB / 1 TB.
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#MacBook Pro M2 Pro / Max em 2026: a ficha técnica útil
Na apresentação, a Apple anunciou para o M2 Pro uma largura de banda de 200 GB/s e até 32 GB de memória unificada, e para o M2 Max, 400 GB/s, até 96 GB e uma GPU com até 38 núcleos. A Apple apresentou esses 96 GB como uma ampliação dos limites da memória gráfica em um notebook. A memória é soldada ao processador, então a configuração é escolhida na compra e não muda mais.
| Chip | Largura de banda | Opções de memória | GPU |
|---|---|---|---|
| M2 Pro | 200 GB/s | 16 ou 32 GB | 16 ou 19 núcleos |
| M2 Max | 400 GB/s | 32, 64 ou 96 GB | 30 ou 38 núcleos |
O resfriamento ativo é a segunda vantagem em comparação com um MacBook Air: o MacBook Pro consegue sustentar cargas prolongadas sem que o chip precise reduzir significativamente sua velocidade. A Apple também oferece, em alguns modelos, um modo de alta potência que permite que os ventiladores girem mais rápido; é uma configuração para experimentar durante gerações prolongadas, ao custo de mais ruído.
#M2 Pro ou M2 Max: o que a largura de banda realmente muda
IA local no seu Mac, a fundo: memória unificada, MLX vs GGUF, o modelo certo para seu chip, Ollama e LM Studio ajustados para Apple Silicon.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
A geração de texto lê, em cada token, todos os pesos ativos do modelo. A velocidade máxima é, portanto, a largura de banda dividida pelo tamanho dos pesos. Um M2 Max com 400 GB/s pode, teoricamente, ser duas vezes mais rápido que um M2 Pro com 200 GB/s. As medições publicadas no repositório llama.cpp mostram que isso é verdade apenas parcialmente.
| Chip (núcleos de GPU) | Largura de banda | Q4_0 | Q8_0 | F16 |
|---|---|---|---|---|
| M2 Pro (19) | 200 GB/s | 38,86 t/s | 23,01 t/s | 13,06 t/s |
| M2 Max (30) | 400 GB/s | 60,99 t/s | 39,97 t/s | 24,16 t/s |
| M2 Max (38) | 400 GB/s | 65,95 t/s | 41,83 t/s | 24,65 t/s |
Com um modelo de 7B em Q4_0, o M2 Max entrega apenas 1,6 a 1,7 vezes o desempenho do M2 Pro. Com o mesmo modelo em F16, de cerca de 13 GB, essa relação chega a quase 1,9. O cálculo explica isso: um modelo pequeno é lido tão rápido que outras limitações (cálculo, latência, sobrecarga) passam a predominar, enquanto um modelo grande realmente satura a memória. A consequência prática é contraintuitiva: quanto maior o modelo, mais o M2 Max justifica seu preço. Para um 7B, um M2 Pro é mais que suficiente.
#De 16 a 96 GB: o que cabe, o que ainda fica apertado
Em máquinas com Apple Silicon, a GPU não tem acesso a toda a memória por padrão: segundo as discussões no repositório llama.cpp, o Metal disponibiliza entre dois terços e três quartos dela. Com 16 GB, conte com cerca de 10 a 12 GB para o modelo e seu contexto; com 96 GB, cerca de 64 a 72 GB. O limite pode ser aumentado por meio de um ajuste do sistema detalhado no guia dedicado, mas ultrapassá-lo pode travar a máquina.
| Modelo | Pesos Q4 | M2 Pro 16 GB | M2 Pro 32 GB | M2 Max 64 GB | M2 Max 96 GB |
|---|---|---|---|---|---|
| Qwen 3.5 9B | 6 GB | Confortável | Sim | Sim | Sim |
| Gemma 4 12B | 7 GB | Apenas | Sim | Sim | Sim |
| Mistral Small 3.2 24B | 14 GB | Não | Sim | Sim | Sim |
| Qwen 3.5 27B | 16 GB | Não | Sim, contexto moderado | Sim | Sim |
| Qwen3-Coder 30B-A3B (MoE) | 19 GB | Não | Sim, contexto moderado | Sim | Sim |
| Qwen 3.6 35B-A3B (MoE) | 21 GB | Não | Apenas | Sim | Sim |
| Llama 3.3 70B | 40 GB | Não | Não | Sim, contexto curto | Sim |
Modelos MoE como Qwen3-Coder 30B-A3B ou Qwen 3.6 35B-A3B ocupam 19 e 21 GB, mas ativam apenas cerca de 3 bilhões de parâmetros por token: com a mesma quantidade de memória, geram muito mais rápido do que um modelo denso de 27B. É a opção com o melhor custo-benefício em 32 GB. Em 96 GB, a vantagem do M2 Max está menos em carregar um único modelo muito grande e mais em manter dois modelos residentes na memória ao mesmo tempo, por exemplo, um modelo de chat e um modelo de código.
#Taxas publicadas: o que se pode afirmar e o que não se pode
Não temos medições próprias nessa máquina, e os tokens por segundo dependem do modelo, da quantização, do contexto e da versão do llama.cpp ou do Ollama. As únicas medições que citamos são as publicadas por usuários com um Llama 7B, que dão uma ideia da ordem de grandeza. Para um modelo mais recente, dividir a largura de banda pelo tamanho dos pesos continua sendo a abordagem adequada, com a margem de erro indicada acima.
O processamento do prompt segue outra lógica: a tabela do llama.cpp indica, para esse mesmo Llama 7B em F16, 384 t/s no processamento do prompt em um M2 Pro com 19 núcleos e 756 t/s em um M2 Max com 38 núcleos. O número de núcleos da GPU influencia essa fase, não a geração. Para um RAG ou a análise de um documento longo, o tempo de espera até a primeira palavra será, portanto, aproximadamente a metade em um M2 Max em comparação com um M2 Pro.
#Instalar Ollama e usá-lo corretamente no Mac
Ollama exige macOS Sonoma (14) ou mais recente. No Mac, a FAQ oficial esclarece que, quando Ollama é executado como aplicativo, suas variáveis de ambiente são definidas com launchctl e, em seguida, o aplicativo deve ser reiniciado. Os exports em um terminal não são suficientes: o aplicativo não os vê.
A FAQ do Ollama indica que o cache K/V quantizado em q8_0 utiliza aproximadamente metade da memória do formato f16 padrão e que é necessário ter o Flash Attention ativo para aproveitá-lo. Em um 70B com contexto longo, é esse ajuste que faz o cache caber na memória. Uma limitação a considerar: a quantização do cache pode degradar levemente a qualidade em alguns modelos; teste em seus casos antes de mantê-la.
#Qual modelo para qual uso
- Chat geral
- Um modelo de 8 a 12B (Qwen 3.5 9B, Gemma 4 12B) responde rápido no M2 Pro; um modelo de 27B se torna interessante a partir de 32 GB para um francês mais bem elaborado.
- Código
- Um modelo MoE de código como Qwen3-Coder 30B-A3B em 32 GB ou mais, ou um modelo de agente de código de 24B como Devstral Small 2 (14 GB em Q4). Para autocompletar em linha, um modelo de 7B é suficiente.
- RAG documental
- Gemma 4 12B em velocidade, um modelo de 24B em qualidade de raciocínio; limite o contexto para não aumentar a espera até a primeira palavra.
- Análise longa, agentes
- Com 64 GB ou mais: Qwen 3.6 35B-A3B como MoE rápido, ou um modelo de 70B para priorizar a qualidade, desde que você aceite cerca de 10 t/s na melhor das hipóteses (400 ÷ 40).
Um ponto de atenção com modelos de raciocínio: eles geram blocos longos de reflexão antes da resposta, o que multiplica a quantidade de tokens a serem gerados. Em uma máquina de 60 t/s, dez mil tokens de reflexão levam quase três minutos. Para perguntas simples, desative o modo de reflexão quando o modelo permitir.
#Na bateria, sob carga prolongada: o que muda
O MacBook Pro foi projetado para sustentar o desempenho por mais tempo que um Air, mas continua sendo um notebook. Dois ajustes influenciam as taxas de processamento: o modo de alimentação (quando funciona com bateria, o macOS pode limitar a potência) e, nos modelos que o oferecem, o modo de alta potência. Segundo a Apple, esse modo permite que as ventoinhas girem mais rápido para manter um desempenho melhor em cargas muito intensas, com mais ruído. Para uma geração de vários minutos, conecte o notebook à fonte de alimentação e experimente esse modo.
#Você precisa passar para um M4 Max?
O M4 Max atinge 546 GB/s e 128 GB de memória, de acordo com a Apple. Na tabela do llama.cpp, um Llama 7B em Q4_0 passa de 65,95 t/s no M2 Max com 38 núcleos para 83,06 t/s no M4 Max com 40 núcleos: cerca de 26% a mais. O ganho é real para uso intenso, mas o M2 Max de 96 GB mantém uma vantagem de capacidade em relação a um M4 Pro, limitado a 64 GB.
| Situação | Recomendação |
|---|---|
| Você usa principalmente modelos de 8–14B | Um M2 Pro de 32 GB é suficiente; não pague por largura de banda extra |
| Você carrega modelos de 27 a 35B todos os dias | M2 Max com 64 ou 96 GB: é nessa faixa que ele se justifica |
| Você quer rodar um 70B com folga ou manter dois modelos carregados na memória | M2 Max 96 GB, ou M4 Max 128 GB se a velocidade for importante |
| Você procura um servidor sem tela | Um Mac mini M4 Pro ou um Mac Studio é mais adequado |
- MacBook Pro M3
- MacBook Pro M4
- Mac Studio com 64 a 512 GB
- Ficha de hardware: MacBook Pro M4 Max
- Fonte: medições do llama.cpp em chips Apple
- Fonte: Apple, lançamento do MacBook Pro M2 Pro e M2 Max
- Fonte: FAQ oficial do Ollama
#Perguntas frequentes
Um MacBook Pro M2 Pro de 16 GB é suficiente para IA local?+
Qual a diferença entre GPU M2 Max com 30 e 38 núcleos?+
É possível rodar dois LLM em paralelo em um M2 Max 64 GB?+
Qual modelo para francês em um MacBook Pro M2 Max?+
O M2 Max aquece mais que o M1 Max em inferência?+
É necessário instalar o MLX junto com o Ollama em um M2 Max?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.