Qual LLM para Mac mini M4 / M4 Pro (16–64 GB) ?
Um Mac mini M4 roda corretamente um LLM local a partir de 16 GB: modelos de 7 a 12 bilhões de parâmetros, a cerca de vinte tokens/s no máximo em um 7B em Q4_0, pois seus 120 GB/s de largura de banda limitam a velocidade. Para mirar 14 a 35 bilhões de parâmetros, é necessário um M4 Pro (273 GB/s, 24 a 64 GB). Apple substituiu essa linha em agosto de 2026 pelos Mac mini M6 e M5 Pro.
Este guia usa os números da Apple, do llama.cpp e da documentação do Ollama e do LM Studio para orientar uma decisão: qual chip, quanta memória, qual modelo e que velocidade esperar. Ele distingue o que a Apple anuncia, o que a comunidade mediu e o que é apenas um cálculo, e apresenta um panorama da linha M6 e M5 Pro lançada em setembro de 2026.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Opção de compra para este guia: Mac mini M5 Pro (24 GB / 512 GB).
Por que essa escolha? Nossa ficha completa sobre Mac mini M5 Pro (24 GB / 512 GB) →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#Mac mini M4 e LLM local: o que a máquina sabe fazer
Um Mac mini é um bom servidor de LLM local porque sua memória unificada é compartilhada entre o processador e a GPU, sem VRAM separada. Dois números determinam o que você pode fazer com ele. A capacidade (16 a 64 GB, dependendo do chip) define o tamanho do modelo que pode ser carregado: 7 a 12 bilhões de parâmetros em 16 GB, 24 a 35 bilhões em 32 a 48 GB. A largura de banda define a velocidade: 120 GB/s para o chip M4, 273 GB/s para o M4 Pro, segundo a Apple. Um LLM relê seus pesos a cada token produzido, então a taxa máxima de geração é aproximadamente a largura de banda dividida pelo tamanho dos pesos. Para um modelo 7B em Q4_0, a tabela pública do llama.cpp indica 24,1 tokens/s para um M4 e cerca de 50 para um M4 Pro. A Apple apresentou em agosto de 2026 os Mac mini M6 e M5 Pro, que substituem essa linha; o M4 ainda estava disponível em alguns revendedores no fim de agosto.
- Mac mini M4
- CPU de 10 núcleos, GPU de 10 núcleos, 120 GB/s, 16 GB de memória unificada (24 ou 32 GB como opção), Thunderbolt 4.
- Mac mini M4 Pro
- CPU de 12 núcleos, GPU de 16 núcleos (14 e 20 opcionais), 273 GB/s, 24 GB de memória (48 ou 64 GB opcionais), Thunderbolt 5.
- Formato e ruído
- 12,7 × 12,7 × 5,0 cm, 0,67 kg (M4) ou 0,73 kg (M4 Pro); 5 dBA em repouso, conforme Apple.
- Consumo anunciado
- M4: 4 W em repouso, 65 W no máximo. M4 Pro: 5 W e 140 W. A Apple não divulga valores de consumo durante a inferência.
#Mac mini M4 ou M4 Pro: a largura de banda é decisiva
Você sabe qual modelo cabe no seu Mac mini M4. O kit do Mac ensina você a tirar o máximo dele: ampliar o limite de memória da GPU (cap. 2), escolher entre MLX e GGUF (cap. 3) e transformar seu Mac mini em um servidor de IA para toda a casa (cap. 12).
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
Entre os dois chips, a verdadeira diferença não é a memória máxima (32 GB contra 64 GB), mas a largura de banda, multiplicada por 2,3 (273 ÷ 120). Na tabela do llama.cpp, a relação medida é de 2,1 na geração (50,7 ÷ 24,1 em Q4_0) e de 2,0 na leitura do prompt (440 ÷ 221).
| Critério | Mac mini M4 | Mac mini M4 Pro |
|---|---|---|
| Largura de banda da memória (Apple) | 120 GB/s | 273 GB/s |
| Memória unificada (Apple) | 16 GB, opção 24 ou 32 GB | 24 GB, com opção de 48 ou 64 GB |
| Geração, Llama 2 7B em Q4_0 (llama.cpp) | 24,1 tokens/s | 50,7 tokens/s (GPU de 20 núcleos) |
| Geração, mesmo modelo em Q8_0 | 13,5 tokens/s | 30,7 tokens/s |
| Leitura do prompt, Q4_0 | 221 tokens/s | 440 tokens/s |
| Portas Thunderbolt (Apple) | Thunderbolt 4, 40 Gb/s | Thunderbolt 5, 120 Gb/s |
- O M4 é suficiente se
- você é o único usuário, busca modelos de até 12 bilhões de parâmetros (Qwen 3.5 9B, Gemma 4 12B) e aceita cerca de vinte tokens/s no melhor dos casos. Opte por 24 GB para manter também um modelo de embeddings carregado.
- O M4 Pro é a escolha certa se
- Seu objetivo são modelos com 14 a 27 bilhões de parâmetros, um MoE com 30 a 35 bilhões (no mínimo 48 GB), um agente de código ou múltiplos usuários. Acima de 64 GB, é necessário um Mac Studio.
#VRAM no Mac mini: a memória unificada e seu limite de uso pela GPU
Um Mac mini não possui VRAM separada, mas o GPU não consegue usar toda a memória. De acordo com os usuários do llama.cpp, a limitação padrão é de dois terços a três quartos da RAM; ao iniciar, o llama.cpp exibe a linha recommendedMaxWorkingSetSize, que mostra o valor real. A configuração iogpu.wired_limit_mb tem valor 0 por padrão, o que significa 'política padrão do sistema' e não 'ilimitado'.
| Memória do Mac mini | Limite estimado de memória da GPU | Memória restante para macOS |
|---|---|---|
| 16 GB | 10,7 a 12 GB | 4 a 5 GB |
| 24 GB | 16 a 18 GB | 6 a 8 GB |
| 32 GB | 21 a 24 GB | 8 a 11 GB |
| 48 GB | 32 a 36 GB | 12 a 16 GB |
| 64 GB | 43 a 48 GB | 16 a 21 GB |
O limite deve comportar os pesos, o cache KV (a memória do contexto, que cresce com a conversa) e os buffers de cálculo. Para carregar um modelo que se aproxima do limite, esse limite é aumentado: o MLX recomenda um valor superior ao tamanho do modelo em megabytes, mas inferior à memória da máquina. Deixe vários gigabytes para o macOS; caso contrário, a velocidade despenca. Uma configuração manual via sysctl pode não persistir após uma reinicialização.
#Qual modelo para qual memória: o que cabe em um Mac mini
A tabela cruza o tamanho dos arquivos publicados pelo Ollama com um limite de dois terços da RAM (hipótese prudente). “Sim”: os pesos ocupam menos de 70% do limite, e sobra espaço para o cache KV. “No limite”: eles cabem, com um contexto curto. “Não”: eles excedem o limite. São cálculos, não medições.
| Modelo | Peso (Ollama) | M4 16 GB | M4 24 GB | M4 32 GB | M4 Pro 48 GB | M4 Pro 64 GB |
|---|---|---|---|---|---|---|
| Qwen 3.5 9B | 6,6 GB | sim | sim | sim | sim | sim |
| Gemma 4 12B | 7,6 GB | apenas | sim | sim | sim | sim |
| gpt-oss 20B | 14 GB | não | apenas | sim | sim | sim |
| Mistral Small 24B | 14 GB | não | apenas | sim | sim | sim |
| Qwen 3.8 27B | 18 GB | não | não | apenas | sim | sim |
| Qwen3-Coder 30B-A3B | 19 GB | não | não | apenas | sim | sim |
| Qwen 3.6 35B-A3B (MoE) | 23 GB | não | não | não | apenas | sim |
| Qwen3-Coder 30B-A3B em Q8_0 | 32 GB | não | não | não | apenas | apenas |
#Mac mini M4 16 GB: os modelos a preferir
Com 16 GB, o limite fica em torno de 11 GB. Qwen 3.5 9B (6,6 GB no Ollama) deixa cerca de 4 GB para o cache KV e os buffers. Gemma 4 12B (7,6 GB) funciona com um contexto curto. Um modelo de 14 GB como Mistral Small 24B excede esse limite: o Ollama o distribui entre GPU e CPU, e a velocidade cai. O comando ollama ps mostra a distribuição; procure manter a execução 100% na GPU.
#Velocidade de um Mac mini: limite teórico e medições publicadas
A taxa de geração é limitada pela largura de banda: tokens por segundo ≈ largura de banda (GB/s) ÷ pesos lidos a cada token (GB). Esse cálculo fornece um limite teórico, nunca uma medição real. Para um modelo denso de 14 GB, 120 ÷ 14 dá 8,6 tokens/s no máximo em um M4, e 273 ÷ 14 dá 19,5 em um M4 Pro.
| Modelo | Tamanho do modelo | M4 (120 GB/s) | M4 Pro (273 GB/s) |
|---|---|---|---|
| Qwen 3.5 9B | 6,6 GB | 18 | 41 |
| Gemma 4 12B | 7,6 GB | 16 | 36 |
| Mistral Small 24B | 14 GB | 8,6 | 19,5 |
As medições publicadas ficam abaixo desse limite. A seguir estão as medições da tabela que a comunidade llama.cpp mantém atualizada para os chips Apple, com Llama 2 7B. Não são nossas medições e se referem a um modelo antigo em Q4_0 e Q8_0, mas mostram a relação entre os chips.
| Chip | Largura de banda | Geração Q4_0 | Geração Q8_0 | Prompt Q4_0 |
|---|---|---|---|---|
| M4 (GPU com 10 núcleos) | 120 GB/s | 24,1 | 13,5 | 221 |
| M4 Pro (GPU de 16 núcleos) | 273 GB/s | 49,6 | 30,5 | 364 |
| M4 Pro (GPU com 20 núcleos) | 273 GB/s | 50,7 | 30,7 | 440 |
| M5 Pro (GPU com 20 núcleos) | 307 GB/s | 66,3 | 38,9 | 1 621 |
Passar de Q8_0 para Q4_0 acelera a geração em 1,8x no M4 e 1,7x no M4 Pro: o tamanho do arquivo conta mais que o cálculo. Os núcleos GPU têm maior impacto na leitura do prompt (364 contra 440 tokens/s no M4 Pro). A tabela não contém nenhuma medição para o M6 na data de consulta.
#Mac mini M6 e M5 Pro: o que a nova linha muda para um LLM
A Apple anuncia para o Mac mini M6 uma velocidade de processamento do prompt no LM Studio até 4,8 vezes maior que a do M4, e para o M5 Pro até 4 vezes maior que a do M4 Pro. Esses ganhos se referem à leitura do prompt, que aproveita os aceleradores neurais adicionados a cada núcleo da GPU. A geração continua determinada pela largura de banda e melhora bem menos: de 12% (307 contra 273 GB/s) a 42% (170 contra 120 GB/s).
| Chip | Largura de banda | Memória unificada | Repouso / máximo |
|---|---|---|---|
| M4 | 120 GB/s | 16, 24 ou 32 GB | 4 W / 65 W |
| M6 | 153 GB/s (16 GB), 170 GB/s (24 GB e mais) | 16, 24 ou 32 GB | 4 W / 70 W |
| M4 Pro | 273 GB/s | 24, 48 ou 64 GB | 5 W / 140 W |
| M5 Pro | 307 GB/s | 24, 48 ou 64 GB | 6 W / 145 W |
Um M6 básico com 153 GB/s tem apenas 28% mais largura de banda do que o M4: o limite teórico de um 9B passa de 18 para cerca de 23 tokens/s. A nova linha beneficia principalmente os usos com contexto longo: um RAG que injeta documentos longos, um agente de código que relê um repositório.
- Máquina nova, modelo de 30 a 35 bilhões de parâmetros
- Um M5 Pro com pelo menos 48 GB, 64 GB para se sentir confortável com um MoE de 35 bilhões: o M6 atinge apenas 32 GB.
- M4 ainda em estoque
- Coerente para 7 a 12 bilhões de parâmetros, se houver uma diferença de preço clara em relação ao M6. Este estoque é limitado.
#Instalar um servidor LLM em um Mac mini com Ollama
O Ollama no macOS funciona como um aplicativo, cujas configurações são feitas por meio de variáveis de ambiente definidas com launchctl. Por padrão, o Ollama escuta apenas em 127.0.0.1, na porta 11434: sem alterações, nenhum outro dispositivo pode usá-lo.
- 01Instalar o aplicativo OllamaBaixe o Ollama de ollama.com e coloque o aplicativo na pasta Aplicativos. Na primeira execução, ele oferece criar o link do comando ollama.
- 02Abrir a porta para a rede localDefina OLLAMA_HOST com launchctl (comando abaixo), depois reinicie o aplicativo. O endereço 0.0.0.0 abre a API para toda a rede, sem autenticação: use esse endereço apenas em uma rede de confiança.
- 03Impedir a suspensãoEm Configurações do Sistema, na seção Energia, ative a opção que impede a suspensão automática quando a tela está apagada: sem ela, o serviço pode ser interrompido.
- 04Baixar um modelo adequadoEscolha, no quadro, um modelo marcado "sim" para sua memória, por exemplo qwen3.5:9b em 16 GB.
- 05Verificar a partir de outro dispositivoEnvie uma requisição para o endereço do Mac mini (nome .local ou IP), depois execute ollama ps: a coluna Processor deve exibir 100% GPU.
Dois ajustes frequentemente copiados são inúteis aqui: a documentação do Ollama esclarece que o Flash Attention é ativado automaticamente quando o hardware permite, e OLLAMA_ORIGINS diz respeito às extensões de navegador. Por outro lado, quantizar o cache KV (OLLAMA_KV_CACHE_TYPE=q8_0) reduz seu tamanho aproximadamente pela metade com uma perda muito pequena, o que faz diferença em uma máquina com 16 GB quando o contexto aumenta.
#LM Studio: a alternativa ao Ollama
O LM Studio exige um chip Apple Silicon e macOS 14 ou mais recente, com 16 GB de RAM recomendados. Desde a versão 0.3.4, ele carrega tanto modelos GGUF quanto MLX. Sem tela, seu daemon llmster é iniciado com lms daemon up. A opção “Serve on Local Network” disponibiliza a API na rede; a autenticação por token não é ativada por padrão. O mecanismo MLX do Ollama, apresentado em versão preliminar em março de 2026, exigia mais de 32 GB: um M4 com 16 GB não podia se beneficiar dele.
#O que um Mac mini pode oferecer: chat, RAG, agentes, cluster
- Servidor de chat em casa
- As APIs do Ollama e do LM Studio aceitam clientes no formato OpenAI (Open WebUI, Zed, scripts). Colocado perto do roteador, o Mac mini atende toda a casa.
- RAG documental
- É necessário carregar o modelo de geração e um modelo de embeddings. nomic-embed-text pesa 274 MB: em 16 GB, cabe ao lado de Qwen 3.5 9B.
- Agente de código
- Um agente envia prompts longos em cada etapa: a leitura do prompt conta mais do que a geração, e é aqui que M6 e M5 Pro ganham mais.
#Quantos usuários simultâneos?
Ollama processa uma requisição de cada vez por modelo por padrão (OLLAMA_NUM_PARALLEL vale 1). Cada requisição paralela aumenta o contexto alocado: de acordo com a documentação, 4 requisições com um contexto de 2.000 tokens alocam 8.000 tokens. Memória do cache = cache de uma conversa × requisições paralelas. Cada pessoa recebe sua resposta mais lentamente; não existe aqui uma medição confiável para um número específico de pessoas.
#Ligar vários Mac mini em cluster
Somente o M4 Pro oferece Thunderbolt 5 (120 Gb/s); o M4 se limita a Thunderbolt 4 (40 Gb/s). O projeto exo oferece suporte a RDMA via Thunderbolt 5, que reduziria em 99% a latência entre máquinas, e afirma acelerar os modelos à medida que se adicionam dispositivos, com macOS 26.2 ou superior. Seus benchmarks foram realizados em Mac Studio, não em Mac mini. Um cluster serve principalmente para carregar um modelo grande demais para uma única máquina.
- Compartilhar Ollama na sua rede local (família, equipe)
- Segurança do servidor Ollama: autenticação e reverse proxy
- Exo: transformar várias máquinas em um cluster LLM doméstico
- Otimizar seu Mac com Apple Silicon: limite de GPU, Flash Attention, cache KV
- Informações do hardware: Mac mini M6
- Informações do hardware: Mac mini M5 Pro
#Mac mini M4 ou MacBook Air M4: mesmo chip, uso diferente
O MacBook Air de 13 polegadas com M4 utiliza o mesmo chip, com a mesma largura de banda (120 GB/s) e as mesmas opções de 16, 24 ou 32 GB: a velocidade máxima é a mesma. O que muda é o chassi. A versão antiga deste guia indicava uma redução de 20% no desempenho do Air após dez minutos; nenhuma fonte confirma essa redução, e essa afirmação foi retirada. Para um serviço ligado continuamente, o Mac mini é a escolha natural; para um computador portátil (1,24 kg, tela e bateria incluídos), o MacBook.
- Fonte: Apple, ficha técnica do Mac mini (2024)
- Fonte: Apple, anúncio dos Mac mini M6 e M5 Pro (agosto de 2026)
- Fonte: llama.cpp, desempenho em chips Apple da série M
- Fonte: documentação Ollama, FAQ (variáveis de ambiente, cache KV)
- Fonte: documentação LM Studio, modo servidor sem interface
#Perguntas frequentes
Um Mac mini M4 com 16 GB é suficiente para um LLM local?+
Qual o melhor LLM para um Mac mini M4 de 16 GB?+
Mac mini M4 ou M4 Pro para IA local?+
O Mac mini M6 é muito mais rápido que o M4 para um LLM?+
É possível ligar vários Mac mini em cluster para um LLM?+
Quanto consome um Mac mini M4 como servidor LLM 24 h/24?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.