Qual LLM no Mac mini M2 / M2 Pro (8–32 GB) ?
Um Mac mini M2 ou M2 Pro serve como um servidor LLM doméstico silencioso: com 16 GB de memória unificada, ele executa um modelo de 8 a 9B em Q4; com 32 GB (apenas no M2 Pro), um modelo de 24 a 32B ou um MoE de 30 a 35B. O que determina o conforto de uso é a largura de banda: 100 GB/s no M2 contra 200 GB/s no M2 Pro. Com o mesmo modelo, o M2 Pro gera quase duas vezes mais rápido. Evite a versão de 8 GB.
O Mac mini M2 de janeiro de 2023 foi substituído pelo M4 no fim de 2024, mas continua muito presente no mercado de usados. Esta página explica o que cada configuração de memória realmente permite, quais resultados as medições publicadas apresentam em tokens por segundo, como configurá-lo como servidor Ollama acessível em toda a rede local e a partir de quando um modelo mais recente passa a ser preferível.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Opção de compra para este guia: Mac mini M5 Pro (24 GB / 512 GB).
Por que essa escolha? Nossa ficha completa sobre Mac mini M5 Pro (24 GB / 512 GB) →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#Mac mini M2 / M2 Pro em 2026: o que a ficha técnica promete
A Apple apresentou o Mac mini M2 em janeiro de 2023 com “até 24 GB de memória unificada e 100 GB/s de largura de banda”, e o M2 Pro com 200 GB/s, ou seja, o dobro, e até 32 GB de memória. As fichas técnicas da Apple indicam as configurações padrão e personalizadas: o M2 parte de 8 GB, podendo ser configurado com 16 ou 24 GB; o M2 Pro parte de 16 GB, podendo ser configurado com 32 GB. Portanto, não existe M2 com 32 GB nem M2 Pro com 8 GB. A memória é soldada: a escolha é feita na compra, não depois.
- Mac mini M2
- 8 núcleos de CPU, 10 núcleos de GPU, 100 GB/s, 8, 16 ou 24 GB de memória unificada.
- Mac mini M2 Pro
- 10 ou 12 núcleos de CPU, 16 ou 19 núcleos de GPU, 200 GB/s, 16 ou 32 GB.
- Refrigeração
- Ventoinha ativa: a Apple anuncia um sistema térmico projetado para desempenho sustentado, o que é importante para uma máquina que responde a requisições o dia todo.
- Consumo
- Segundo a ficha técnica oficial da Apple: 7 W em repouso, no máximo 50 W para o M2 e no máximo 100 W para o M2 Pro. Os valores mais baixos que às vezes aparecem (10 a 30 W) são medições feitas por usuários, não limites máximos.
#M2 ou M2 Pro: a escolha depende da largura de banda
IA local no seu Mac, a fundo: memória unificada, MLX vs GGUF, o modelo certo para seu chip, Ollama e LM Studio ajustados para Apple Silicon.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
Na geração de texto, cada token obriga o chip a reler todos os pesos ativos do modelo a partir da memória. A velocidade é, portanto, limitada pela largura de banda dividida pelo tamanho do modelo. Um M2 com 100 GB/s e um modelo de 5 GB dão um limite teórico próximo de 20 tokens por segundo; o M2 Pro, com 200 GB/s, dobra esse limite. A capacidade de memória, por sua vez, determina apenas o que cabe: um modelo de 24B em Q4 (cerca de 14 GB) não deixa nada para o sistema em uma máquina de 16 GB.
| Critério | Mac mini M2 | Mac mini M2 Pro |
|---|---|---|
| Largura de banda | 100 GB/s | 200 GB/s |
| Opções de memória | 8, 16 ou 24 GB | 16 ou 32 GB |
| Uso mais exigente com conforto | 8-9B em Q4 com 16 GB; 12-14B com 24 GB | 24B a 32B em Q4 em 32 GB |
| Múltiplos usuários, RAG | Um ou dois usuários com uso leve | Várias requisições curtas são aceitáveis |
| Consumo máximo (Apple) | 50 W | 100 W |
O M2 com 24 GB é a configuração híbrida: tem a capacidade de um 14B, mas mantém a largura de banda do M2. Por isso, carrega modelos maiores que o M2 de 16 GB sem aumentar a velocidade. Escolha esse modelo se quiser uma janela de contexto longa ou dois modelos carregados; caso contrário, o M2 Pro de 16 GB, duas vezes mais rápido para o mesmo modelo, geralmente é melhor para uso interativo.
#Qual modelo para qual memória: o cálculo, não a promessa
Nem tudo pode ser colocado na memória da GPU. No Apple Silicon, o Metal limita por padrão a parcela da memória unificada que a GPU pode usar a um valor entre dois terços e três quartos, segundo as discussões no repositório llama.cpp. Em uma máquina de 16 GB, conte com cerca de 10 a 12 GB para o modelo e seu contexto, deixando o restante para o macOS. A referência do site para os pesos em Q4 é 8B ≈ 5 GB, 14B ≈ 9 GB, 32B ≈ 19–20 GB; o cache de contexto deve ser somado a esses valores.
| Modelo (Q4) | Tamanho do modelo | M2 8 GB | M2 16 GB | M2 24 GB / M2 Pro 16 GB | M2 Pro 32 GB |
|---|---|---|---|---|---|
| Qwen 3.5 4B | 2,3 GB | Sim | Sim | Sim | Sim |
| Granite 4.2 8B | 4,6 GB | Apenas | Sim | Sim | Sim |
| Qwen 3.5 9B | 6 GB | Não | Sim | Sim | Sim |
| Gemma 4 12B | 7 GB | Não | Apenas | Sim | Sim |
| Mistral Small 3.2 24B | 14 GB | Não | Não | Não (24 GB: muito apertado) | Sim |
| Qwen 3.6 35B-A3B (MoE) | 21 GB | Não | Não | Não | Sim, margem baixa |
Como interpretar a tabela: « No limite » significa que os pesos cabem na memória, mas o contexto longo e o macOS disputam o espaço restante. A versão de 8 GB deve ser descartada para qualquer uso sério: o macOS e o navegador já ocupam metade da memória. O MoE 35B-A3B é um caso especial: ocupa 21 GB, mas ativa apenas cerca de 3 bilhões de parâmetros por token, o que o torna significativamente mais rápido que um modelo denso de mesmo tamanho. Essa é a melhor razão para escolher um M2 Pro de 32 GB.
#As taxas de processamento medidas: o que a fonte publicada permite dizer
Não temos medições próprias e não apresentamos nenhuma. A referência pública mais útil é a discussão «Performance of llama.cpp on Apple Silicon M-series» no repositório llama.cpp, onde usuários publicam resultados de geração de texto (tg128) de um modelo Llama 7B em cada chip Apple. Esses números correspondem à versão do llama.cpp da época e a um modelo mais antigo que os atuais, mas dão uma ideia da ordem de grandeza.
| Chip | Largura de banda | Q4_0 | Q8_0 | F16 |
|---|---|---|---|---|
| M2, 10 núcleos de GPU | 100 GB/s | 21,91 t/s | 12,21 t/s | 6,72 t/s |
| M2 Pro, 16 núcleos GPU | 200 GB/s | 37,87 t/s | 22,70 t/s | 12,47 t/s |
| M2 Pro, 19 núcleos de GPU | 200 GB/s | 38,86 t/s | 23,01 t/s | 13,06 t/s |
Esta tabela confirma três coisas. Primeiro, a velocidade segue o tamanho dos pesos: passar de Q4_0 para Q8_0 divide aproximadamente por 1,8 a taxa. Segundo, o M2 Pro é cerca de 1,7 vezes mais rápido que o M2, um pouco menos que as 2 vezes da largura de banda. Terceiro, os núcleos de GPU adicionais do M2 Pro de 19 núcleos quase não mudam a geração (38,86 contra 37,87 t/s): eles ajudam no processamento do prompt, não na geração.
#O contexto e o processamento do prompt: o que realmente reduz a velocidade
Os tokens por segundo não dizem tudo. Dois números influenciam a experiência: o tempo de processamento do prompt (coluna pp512 das mesmas medições: 201 t/s em F16 para o M2, 384 t/s para o M2 Pro com 19 núcleos) e o crescimento do cache de contexto. Um documento com 20.000 tokens de entrada exige várias dezenas de segundos antes da primeira palavra, em qualquer Mac dessa geração. Para RAG ou análise de documentos, mantenha trechos curtos em vez de colar um PDF inteiro.
O cache de contexto também ocupa memória: quanto maior a janela, menos espaço sobra para os pesos. Com 16 GB, reduzir a janela para 8.000 ou 16.000 tokens deixa espaço para um modelo maior. O guia sobre a janela de contexto detalha a regra, e o guia sobre o cache KV explica como quantizá-lo.
#Instalar Ollama como servidor 24/7: o procedimento que funciona
Ollama exige macOS Sonoma (14) ou mais recente e escuta por padrão em 127.0.0.1, porta 11434: ou seja, só pode ser acessado a partir da própria máquina. Para torná-lo acessível a outros computadores, é necessário alterar o endereço de escuta. No Mac, a documentação oficial da FAQ indica que, quando Ollama é executado como aplicativo, as variáveis de ambiente são definidas com launchctl, e então o aplicativo deve ser reiniciado.
- 01Instalar o aplicativo OllamaBaixe o aplicativo no site oficial ou use o Homebrew; o guia de instalação no macOS detalha as duas opções. Não use ao mesmo tempo o aplicativo e um serviço Homebrew: eles disputam a mesma porta.
- 02Definir o endereço de escutaExecute launchctl setenv OLLAMA_HOST 0.0.0.0:11434 no Terminal, depois feche e reinicie a aplicação Ollama.
- 03Impedir a suspensãoEm Configurações do Sistema, na seção Economia de Energia, ative a opção que impede a suspensão automática quando a tela estiver apagada e ative o início de sessão automático se o Mac precisar reiniciar sozinho.
- 04Reservar um endereço fixoAtribua um endereço IP fixo ao Mac mini no seu roteador, ou use o nome mac-mini.local na rede local.
- 05Pré-carregar o modeloBaixe o modelo com o comando ollama pull, depois teste de outro computador com o comando curl abaixo.
#O que o Mac mini oferece a toda a casa
O Mac mini M2 não é um servidor de produção, mas é excelente para três usos: um chat familiar, uma API compatível com a OpenAI para suas ferramentas e automações leves. O Ollama oferece suporte a um subconjunto da API OpenAI na mesma porta, o que permite conectar muitos clientes existentes alterando apenas o endereço; verifique se há suporte às funções de que você precisa (ferramentas, saídas estruturadas).
- Chat
- Open WebUI ou uma aplicação móvel compatível com Ollama: insira o endereço http://mac-mini.local:11434 nas configurações.
- Código
- Continue, Aider ou Zed: indique a URL do servidor Ollama como provedor.
- Automatização
- n8n, Home Assistant ou Atalhos iOS: eles sabem chamar uma API HTTP compatível com OpenAI.
- Indexação de documentos
- Um modelo de embedding leve, como nomic-embed-text, deixa espaço para um modelo de chat de 8-9B em 16 GB.
Uma limitação a conhecer: o Ollama processa por padrão uma requisição de cada vez por modelo (OLLAMA_NUM_PARALLEL vale 1). Duas pessoas que fazem uma pergunta ao mesmo tempo, portanto, compartilham a capacidade de processamento ou esperam sua vez. Para uma família, isso é suficiente; para uma equipe com mais de três ou quatro pessoas ativas, é melhor usar uma máquina mais potente ou um servidor de inferência projetado para paralelismo.
#Mac mini M2 ou máquina mais recente: quando mudar
O M4 básico passa para 120 GB/s (valor da tabela do llama.cpp) e o M4 Pro para 273 GB/s, segundo a Apple; como a largura de banda é o fator limitante, a diferença de velocidade é de aproximadamente 20% entre o M2 e o M4 básicos, e bem maior entre o M2 Pro e o M4 Pro. O M2 Pro usado com 32 GB continua sendo uma opção relevante se você busca um modelo de 24 a 32B; para uso de agentes ou trabalho com código em contextos longos, um chip recente com mais memória proporciona maior conforto.
| Situação | Recomendação |
|---|---|
| Chat para a família com modelo de 8-9B, orçamento apertado | M2 de 16 GB de segunda mão é suficiente |
| Modelo de 24 a 32 bilhões ou MoE de 30 a 35 bilhões | M2 Pro de 32 GB, ou um Mac mais recente com 32 GB ou mais |
| Contextos longos, agentes, vários usuários | Um Mac mini M4 Pro ou superior |
| Precisa de 64 GB ou mais | Mac Studio, nunca um M2 mini |
- Mac mini M4 / M4 Pro: o sucessor
- Ficha de hardware: Mac mini M4 Pro
- Configurações do macOS para Apple Silicon
- Instalar Ollama no macOS
- Fonte: Apple, ficha técnica do Mac mini (2023)
- Fonte: Apple, consumo e dissipação térmica do Mac mini
- Fonte: medições do llama.cpp em chips Apple
- Fonte: FAQ oficial do Ollama
#Perguntas frequentes
O Mac mini M2 pode funcionar 24 horas por dia como servidor de LLM?+
Qual Mac mini M2 escolher de segunda mão para IA local?+
Quantos tokens por segundo um Mac mini M2 consegue gerar?+
É possível usar o Mac mini M2 a partir de um iPhone ou de outro computador?+
O Mac mini M2 é mais rápido que um MacBook Air M2?+
É possível fazer o ajuste fino de um modelo em um Mac mini M2 Pro?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.