Iniciante 12 minMac mini

Qual LLM no Mac mini M2 / M2 Pro (8–32 GB) ?

Resposta direta

Um Mac mini M2 ou M2 Pro serve como um servidor LLM doméstico silencioso: com 16 GB de memória unificada, ele executa um modelo de 8 a 9B em Q4; com 32 GB (apenas no M2 Pro), um modelo de 24 a 32B ou um MoE de 30 a 35B. O que determina o conforto de uso é a largura de banda: 100 GB/s no M2 contra 200 GB/s no M2 Pro. Com o mesmo modelo, o M2 Pro gera quase duas vezes mais rápido. Evite a versão de 8 GB.

O Mac mini M2 de janeiro de 2023 foi substituído pelo M4 no fim de 2024, mas continua muito presente no mercado de usados. Esta página explica o que cada configuração de memória realmente permite, quais resultados as medições publicadas apresentam em tokens por segundo, como configurá-lo como servidor Ollama acessível em toda a rede local e a partir de quando um modelo mais recente passa a ser preferível.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no macOS 14+
Hardware recomendado

Opção de compra para este guia: Mac mini M5 Pro (24 GB / 512 GB).

Por que essa escolha? Nossa ficha completa sobre Mac mini M5 Pro (24 GB / 512 GB) →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#Mac mini M2 / M2 Pro em 2026: o que a ficha técnica promete

A Apple apresentou o Mac mini M2 em janeiro de 2023 com “até 24 GB de memória unificada e 100 GB/s de largura de banda”, e o M2 Pro com 200 GB/s, ou seja, o dobro, e até 32 GB de memória. As fichas técnicas da Apple indicam as configurações padrão e personalizadas: o M2 parte de 8 GB, podendo ser configurado com 16 ou 24 GB; o M2 Pro parte de 16 GB, podendo ser configurado com 32 GB. Portanto, não existe M2 com 32 GB nem M2 Pro com 8 GB. A memória é soldada: a escolha é feita na compra, não depois.

Mac mini M2
8 núcleos de CPU, 10 núcleos de GPU, 100 GB/s, 8, 16 ou 24 GB de memória unificada.
Mac mini M2 Pro
10 ou 12 núcleos de CPU, 16 ou 19 núcleos de GPU, 200 GB/s, 16 ou 32 GB.
Refrigeração
Ventoinha ativa: a Apple anuncia um sistema térmico projetado para desempenho sustentado, o que é importante para uma máquina que responde a requisições o dia todo.
Consumo
Segundo a ficha técnica oficial da Apple: 7 W em repouso, no máximo 50 W para o M2 e no máximo 100 W para o M2 Pro. Os valores mais baixos que às vezes aparecem (10 a 30 W) são medições feitas por usuários, não limites máximos.
i
Por que o M2 continua sendo uma opção viável como servidor
O principal ponto forte não é a velocidade pura, mas o equilíbrio entre ruído, espaço ocupado e consumo em repouso: 7 W sem carga, segundo a Apple. Uma máquina que responde dez minutos por dia e fica em suspensão no restante do tempo custa muito pouco para manter funcionando. Para avaliar a velocidade, é preciso observar a largura de banda.

#M2 ou M2 Pro: a escolha depende da largura de banda

O kit Mac

IA local no seu Mac, a fundo: memória unificada, MLX vs GGUF, o modelo certo para seu chip, Ollama e LM Studio ajustados para Apple Silicon.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Na geração de texto, cada token obriga o chip a reler todos os pesos ativos do modelo a partir da memória. A velocidade é, portanto, limitada pela largura de banda dividida pelo tamanho do modelo. Um M2 com 100 GB/s e um modelo de 5 GB dão um limite teórico próximo de 20 tokens por segundo; o M2 Pro, com 200 GB/s, dobra esse limite. A capacidade de memória, por sua vez, determina apenas o que cabe: um modelo de 24B em Q4 (cerca de 14 GB) não deixa nada para o sistema em uma máquina de 16 GB.

M2 ou M2 Pro para um servidor LLM
CritérioMac mini M2Mac mini M2 Pro
Largura de banda100 GB/s200 GB/s
Opções de memória8, 16 ou 24 GB16 ou 32 GB
Uso mais exigente com conforto8-9B em Q4 com 16 GB; 12-14B com 24 GB24B a 32B em Q4 em 32 GB
Múltiplos usuários, RAGUm ou dois usuários com uso leveVárias requisições curtas são aceitáveis
Consumo máximo (Apple)50 W100 W

O M2 com 24 GB é a configuração híbrida: tem a capacidade de um 14B, mas mantém a largura de banda do M2. Por isso, carrega modelos maiores que o M2 de 16 GB sem aumentar a velocidade. Escolha esse modelo se quiser uma janela de contexto longa ou dois modelos carregados; caso contrário, o M2 Pro de 16 GB, duas vezes mais rápido para o mesmo modelo, geralmente é melhor para uso interativo.

#Qual modelo para qual memória: o cálculo, não a promessa

Nem tudo pode ser colocado na memória da GPU. No Apple Silicon, o Metal limita por padrão a parcela da memória unificada que a GPU pode usar a um valor entre dois terços e três quartos, segundo as discussões no repositório llama.cpp. Em uma máquina de 16 GB, conte com cerca de 10 a 12 GB para o modelo e seu contexto, deixando o restante para o macOS. A referência do site para os pesos em Q4 é 8B ≈ 5 GB, 14B ≈ 9 GB, 32B ≈ 19–20 GB; o cache de contexto deve ser somado a esses valores.

O que cabe conforme a memória disponível (tamanhos dos modelos em Q4 segundo o catálogo QuelLLM, sem incluir a memória do contexto)
Modelo (Q4)Tamanho do modeloM2 8 GBM2 16 GBM2 24 GB / M2 Pro 16 GBM2 Pro 32 GB
Qwen 3.5 4B2,3 GBSimSimSimSim
Granite 4.2 8B4,6 GBApenasSimSimSim
Qwen 3.5 9B6 GBNãoSimSimSim
Gemma 4 12B7 GBNãoApenasSimSim
Mistral Small 3.2 24B14 GBNãoNãoNão (24 GB: muito apertado)Sim
Qwen 3.6 35B-A3B (MoE)21 GBNãoNãoNãoSim, margem baixa

Como interpretar a tabela: « No limite » significa que os pesos cabem na memória, mas o contexto longo e o macOS disputam o espaço restante. A versão de 8 GB deve ser descartada para qualquer uso sério: o macOS e o navegador já ocupam metade da memória. O MoE 35B-A3B é um caso especial: ocupa 21 GB, mas ativa apenas cerca de 3 bilhões de parâmetros por token, o que o torna significativamente mais rápido que um modelo denso de mesmo tamanho. Essa é a melhor razão para escolher um M2 Pro de 32 GB.

#As taxas de processamento medidas: o que a fonte publicada permite dizer

Não temos medições próprias e não apresentamos nenhuma. A referência pública mais útil é a discussão «Performance of llama.cpp on Apple Silicon M-series» no repositório llama.cpp, onde usuários publicam resultados de geração de texto (tg128) de um modelo Llama 7B em cada chip Apple. Esses números correspondem à versão do llama.cpp da época e a um modelo mais antigo que os atuais, mas dão uma ideia da ordem de grandeza.

Geração de texto, Llama 7B, llama.cpp (discussão #4167)
ChipLargura de bandaQ4_0Q8_0F16
M2, 10 núcleos de GPU100 GB/s21,91 t/s12,21 t/s6,72 t/s
M2 Pro, 16 núcleos GPU200 GB/s37,87 t/s22,70 t/s12,47 t/s
M2 Pro, 19 núcleos de GPU200 GB/s38,86 t/s23,01 t/s13,06 t/s

Esta tabela confirma três coisas. Primeiro, a velocidade segue o tamanho dos pesos: passar de Q4_0 para Q8_0 divide aproximadamente por 1,8 a taxa. Segundo, o M2 Pro é cerca de 1,7 vezes mais rápido que o M2, um pouco menos que as 2 vezes da largura de banda. Terceiro, os núcleos de GPU adicionais do M2 Pro de 19 núcleos quase não mudam a geração (38,86 contra 37,87 t/s): eles ajudam no processamento do prompt, não na geração.

→
O cálculo para você refazer por conta própria
Para um M2 com largura de banda de 100 GB/s e um arquivo de 3,8 GB, o limite teórico é próximo de 26 t/s; a medição acima (21,91 t/s) representa aproximadamente 84% desse limite. Para um modelo 9B em Q4 de cerca de 6 GB, o mesmo cálculo dá um limite próximo de 16 t/s no M2 e de 33 t/s no M2 Pro, antes das perdas. Esses são limites calculados a partir de medições publicadas, não taxas de geração garantidas.

#O contexto e o processamento do prompt: o que realmente reduz a velocidade

Os tokens por segundo não dizem tudo. Dois números influenciam a experiência: o tempo de processamento do prompt (coluna pp512 das mesmas medições: 201 t/s em F16 para o M2, 384 t/s para o M2 Pro com 19 núcleos) e o crescimento do cache de contexto. Um documento com 20.000 tokens de entrada exige várias dezenas de segundos antes da primeira palavra, em qualquer Mac dessa geração. Para RAG ou análise de documentos, mantenha trechos curtos em vez de colar um PDF inteiro.

O cache de contexto também ocupa memória: quanto maior a janela, menos espaço sobra para os pesos. Com 16 GB, reduzir a janela para 8.000 ou 16.000 tokens deixa espaço para um modelo maior. O guia sobre a janela de contexto detalha a regra, e o guia sobre o cache KV explica como quantizá-lo.

#Instalar Ollama como servidor 24/7: o procedimento que funciona

Ollama exige macOS Sonoma (14) ou mais recente e escuta por padrão em 127.0.0.1, porta 11434: ou seja, só pode ser acessado a partir da própria máquina. Para torná-lo acessível a outros computadores, é necessário alterar o endereço de escuta. No Mac, a documentação oficial da FAQ indica que, quando Ollama é executado como aplicativo, as variáveis de ambiente são definidas com launchctl, e então o aplicativo deve ser reiniciado.

  1. 01
    Instalar o aplicativo Ollama
    Baixe o aplicativo no site oficial ou use o Homebrew; o guia de instalação no macOS detalha as duas opções. Não use ao mesmo tempo o aplicativo e um serviço Homebrew: eles disputam a mesma porta.
  2. 02
    Definir o endereço de escuta
    Execute launchctl setenv OLLAMA_HOST 0.0.0.0:11434 no Terminal, depois feche e reinicie a aplicação Ollama.
  3. 03
    Impedir a suspensão
    Em Configurações do Sistema, na seção Economia de Energia, ative a opção que impede a suspensão automática quando a tela estiver apagada e ative o início de sessão automático se o Mac precisar reiniciar sozinho.
  4. 04
    Reservar um endereço fixo
    Atribua um endereço IP fixo ao Mac mini no seu roteador, ou use o nome mac-mini.local na rede local.
  5. 05
    Pré-carregar o modelo
    Baixe o modelo com o comando ollama pull, depois teste de outro computador com o comando curl abaixo.
Configuração e teste
# Sur le Mac mini
launchctl setenv OLLAMA_HOST "0.0.0.0:11434"
# quitter puis relancer l'application Ollama
ollama pull qwen3:8b

# Depuis un autre poste du réseau local
curl http://mac-mini.local:11434/api/chat -d '{"model":"qwen3:8b","stream":false,"messages":[{"role":"user","content":"Bonjour"}]}'
!
Expor a API: uma decisão de segurança
O Ollama não tem autenticação. Escutar em 0.0.0.0 é adequado para uma rede doméstica confiável; para qualquer acesso externo, nunca configure o encaminhamento da porta 11434 no seu roteador. Use uma VPN ou um proxy reverso com autenticação. Por padrão, um modelo permanece na memória por 5 minutos após a última requisição: ajuste OLLAMA_KEEP_ALIVE se a primeira chamada do dia parecer lenta.

#O que o Mac mini oferece a toda a casa

O Mac mini M2 não é um servidor de produção, mas é excelente para três usos: um chat familiar, uma API compatível com a OpenAI para suas ferramentas e automações leves. O Ollama oferece suporte a um subconjunto da API OpenAI na mesma porta, o que permite conectar muitos clientes existentes alterando apenas o endereço; verifique se há suporte às funções de que você precisa (ferramentas, saídas estruturadas).

Chat
Open WebUI ou uma aplicação móvel compatível com Ollama: insira o endereço http://mac-mini.local:11434 nas configurações.
Código
Continue, Aider ou Zed: indique a URL do servidor Ollama como provedor.
Automatização
n8n, Home Assistant ou Atalhos iOS: eles sabem chamar uma API HTTP compatível com OpenAI.
Indexação de documentos
Um modelo de embedding leve, como nomic-embed-text, deixa espaço para um modelo de chat de 8-9B em 16 GB.

Uma limitação a conhecer: o Ollama processa por padrão uma requisição de cada vez por modelo (OLLAMA_NUM_PARALLEL vale 1). Duas pessoas que fazem uma pergunta ao mesmo tempo, portanto, compartilham a capacidade de processamento ou esperam sua vez. Para uma família, isso é suficiente; para uma equipe com mais de três ou quatro pessoas ativas, é melhor usar uma máquina mais potente ou um servidor de inferência projetado para paralelismo.

#Mac mini M2 ou máquina mais recente: quando mudar

O M4 básico passa para 120 GB/s (valor da tabela do llama.cpp) e o M4 Pro para 273 GB/s, segundo a Apple; como a largura de banda é o fator limitante, a diferença de velocidade é de aproximadamente 20% entre o M2 e o M4 básicos, e bem maior entre o M2 Pro e o M4 Pro. O M2 Pro usado com 32 GB continua sendo uma opção relevante se você busca um modelo de 24 a 32B; para uso de agentes ou trabalho com código em contextos longos, um chip recente com mais memória proporciona maior conforto.

Quando continuar com o M2, quando mudar
SituaçãoRecomendação
Chat para a família com modelo de 8-9B, orçamento apertadoM2 de 16 GB de segunda mão é suficiente
Modelo de 24 a 32 bilhões ou MoE de 30 a 35 bilhõesM2 Pro de 32 GB, ou um Mac mais recente com 32 GB ou mais
Contextos longos, agentes, vários usuáriosUm Mac mini M4 Pro ou superior
Precisa de 64 GB ou maisMac Studio, nunca um M2 mini

#Perguntas frequentes

FAQ
O Mac mini M2 pode funcionar 24 horas por dia como servidor de LLM?+
Sim, foi projetado para permanecer ligado: a Apple informa um consumo de 7 W em repouso, e o aparelho tem um ventilador ativo para suportar cargas prolongadas. O ajuste essencial é impedir a suspensão automática. Em inferência intensiva, o consumo aumenta, mas a Apple indica um máximo de 50 W para o M2 e de 100 W para o M2 Pro.
Qual Mac mini M2 escolher de segunda mão para IA local?+
O M2 Pro 32 GB para modelos de 24 a 32B ou um MoE de 30-35B, o M2 16 GB para modelos de 8-9B ao melhor preço. Evite o 8 GB: o macOS já consome metade. Como a memória é soldada, verifique a configuração exata em 'Sobre este Mac' antes de comprar.
Quantos tokens por segundo um Mac mini M2 consegue gerar?+
As medições publicadas no repositório llama.cpp mostram 21,9 t/s no M2 e 37,9 a 38,9 t/s no M2 Pro, para um Llama 7B em Q4_0. Para um modelo 9B em Q4, espere valores inferiores. São medições de usuários, que devem ser consideradas apenas como uma ordem de grandeza.
É possível usar o Mac mini M2 a partir de um iPhone ou de outro computador?+
Sim. Após definir OLLAMA_HOST como 0.0.0.0:11434, qualquer cliente da rede local compatível com Ollama ou OpenAI pode se conectar a ele, incluindo aplicativos iOS que pedem o endereço do servidor. No entanto, não o exponha na Internet sem VPN nem proxy reverso com autenticação, pois a API do Ollama não oferece autenticação.
O Mac mini M2 é mais rápido que um MacBook Air M2?+
Com o mesmo chip, a largura de banda é a mesma, então as taxas máximas de geração são próximas. A vantagem do Mac mini é a ventoinha ativa: ele mantém a carga sem reduzir sua frequência, enquanto um MacBook Air sem ventoinha acaba ficando mais lento durante gerações longas.
É possível fazer o ajuste fino de um modelo em um Mac mini M2 Pro?+
Para um modelo pequeno, é possível fazer fine-tuning com LoRA via MLX, mas é lento: considere várias horas de acordo com o tamanho do conjunto de dados. Um fine-tuning completo não é viável com 32 GB de memória compartilhada com o macOS. A solução mais razoável é usar o Mac mini para inferência e alugar uma GPU ocasionalmente para treinamento.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.