Iniciante 14 minMac mini

Qual LLM para Mac mini M4 / M4 Pro (16–64 GB) ?

Resposta direta

Um Mac mini M4 roda corretamente um LLM local a partir de 16 GB: modelos de 7 a 12 bilhões de parâmetros, a cerca de vinte tokens/s no máximo em um 7B em Q4_0, pois seus 120 GB/s de largura de banda limitam a velocidade. Para mirar 14 a 35 bilhões de parâmetros, é necessário um M4 Pro (273 GB/s, 24 a 64 GB). Apple substituiu essa linha em agosto de 2026 pelos Mac mini M6 e M5 Pro.

Este guia usa os números da Apple, do llama.cpp e da documentação do Ollama e do LM Studio para orientar uma decisão: qual chip, quanta memória, qual modelo e que velocidade esperar. Ele distingue o que a Apple anuncia, o que a comunidade mediu e o que é apenas um cálculo, e apresenta um panorama da linha M6 e M5 Pro lançada em setembro de 2026.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-29·Testado no macOS 14+
Hardware recomendado

Opção de compra para este guia: Mac mini M5 Pro (24 GB / 512 GB).

Por que essa escolha? Nossa ficha completa sobre Mac mini M5 Pro (24 GB / 512 GB) →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#Mac mini M4 e LLM local: o que a máquina sabe fazer

Um Mac mini é um bom servidor de LLM local porque sua memória unificada é compartilhada entre o processador e a GPU, sem VRAM separada. Dois números determinam o que você pode fazer com ele. A capacidade (16 a 64 GB, dependendo do chip) define o tamanho do modelo que pode ser carregado: 7 a 12 bilhões de parâmetros em 16 GB, 24 a 35 bilhões em 32 a 48 GB. A largura de banda define a velocidade: 120 GB/s para o chip M4, 273 GB/s para o M4 Pro, segundo a Apple. Um LLM relê seus pesos a cada token produzido, então a taxa máxima de geração é aproximadamente a largura de banda dividida pelo tamanho dos pesos. Para um modelo 7B em Q4_0, a tabela pública do llama.cpp indica 24,1 tokens/s para um M4 e cerca de 50 para um M4 Pro. A Apple apresentou em agosto de 2026 os Mac mini M6 e M5 Pro, que substituem essa linha; o M4 ainda estava disponível em alguns revendedores no fim de agosto.

Mac mini M4
CPU de 10 núcleos, GPU de 10 núcleos, 120 GB/s, 16 GB de memória unificada (24 ou 32 GB como opção), Thunderbolt 4.
Mac mini M4 Pro
CPU de 12 núcleos, GPU de 16 núcleos (14 e 20 opcionais), 273 GB/s, 24 GB de memória (48 ou 64 GB opcionais), Thunderbolt 5.
Formato e ruído
12,7 × 12,7 × 5,0 cm, 0,67 kg (M4) ou 0,73 kg (M4 Pro); 5 dBA em repouso, conforme Apple.
Consumo anunciado
M4: 4 W em repouso, 65 W no máximo. M4 Pro: 5 W e 140 W. A Apple não divulga valores de consumo durante a inferência.
!
A linha M4 foi substituída a partir de agosto de 2026
A Apple apresentou os Mac mini M6 e M5 Pro em agosto de 2026, disponíveis a partir de 22 de setembro. As tabelas abaixo se aplicam a um M4 já comprado, em estoque ou usado.

#Mac mini M4 ou M4 Pro: a largura de banda é decisiva

O kit Mac

Você sabe qual modelo cabe no seu Mac mini M4. O kit do Mac ensina você a tirar o máximo dele: ampliar o limite de memória da GPU (cap. 2), escolher entre MLX e GGUF (cap. 3) e transformar seu Mac mini em um servidor de IA para toda a casa (cap. 12).

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Entre os dois chips, a verdadeira diferença não é a memória máxima (32 GB contra 64 GB), mas a largura de banda, multiplicada por 2,3 (273 ÷ 120). Na tabela do llama.cpp, a relação medida é de 2,1 na geração (50,7 ÷ 24,1 em Q4_0) e de 2,0 na leitura do prompt (440 ÷ 221).

Mac mini M4 e M4 Pro para um LLM (fontes: Apple, llama.cpp)
CritérioMac mini M4Mac mini M4 Pro
Largura de banda da memória (Apple)120 GB/s273 GB/s
Memória unificada (Apple)16 GB, opção 24 ou 32 GB24 GB, com opção de 48 ou 64 GB
Geração, Llama 2 7B em Q4_0 (llama.cpp)24,1 tokens/s50,7 tokens/s (GPU de 20 núcleos)
Geração, mesmo modelo em Q8_013,5 tokens/s30,7 tokens/s
Leitura do prompt, Q4_0221 tokens/s440 tokens/s
Portas Thunderbolt (Apple)Thunderbolt 4, 40 Gb/sThunderbolt 5, 120 Gb/s
O M4 é suficiente se
você é o único usuário, busca modelos de até 12 bilhões de parâmetros (Qwen 3.5 9B, Gemma 4 12B) e aceita cerca de vinte tokens/s no melhor dos casos. Opte por 24 GB para manter também um modelo de embeddings carregado.
O M4 Pro é a escolha certa se
Seu objetivo são modelos com 14 a 27 bilhões de parâmetros, um MoE com 30 a 35 bilhões (no mínimo 48 GB), um agente de código ou múltiplos usuários. Acima de 64 GB, é necessário um Mac Studio.

#VRAM no Mac mini: a memória unificada e seu limite de uso pela GPU

Um Mac mini não possui VRAM separada, mas o GPU não consegue usar toda a memória. De acordo com os usuários do llama.cpp, a limitação padrão é de dois terços a três quartos da RAM; ao iniciar, o llama.cpp exibe a linha recommendedMaxWorkingSetSize, que mostra o valor real. A configuração iogpu.wired_limit_mb tem valor 0 por padrão, o que significa 'política padrão do sistema' e não 'ilimitado'.

Limite padrão de memória para a GPU, estimado em dois terços e três quartos da RAM
Memória do Mac miniLimite estimado de memória da GPUMemória restante para macOS
16 GB10,7 a 12 GB4 a 5 GB
24 GB16 a 18 GB6 a 8 GB
32 GB21 a 24 GB8 a 11 GB
48 GB32 a 36 GB12 a 16 GB
64 GB43 a 48 GB16 a 21 GB

O limite deve comportar os pesos, o cache KV (a memória do contexto, que cresce com a conversa) e os buffers de cálculo. Para carregar um modelo que se aproxima do limite, esse limite é aumentado: o MLX recomenda um valor superior ao tamanho do modelo em megabytes, mas inferior à memória da máquina. Deixe vários gigabytes para o macOS; caso contrário, a velocidade despenca. Uma configuração manual via sysctl pode não persistir após uma reinicialização.

Consultar e depois aumentar o limite (exemplo: M4 Pro 48 GB)
# Valeur actuelle : 0 = plafond par défaut du système
sysctl iogpu.wired_limit_mb

# 40 Go pour le GPU sur 48 Go de RAM (40 x 1024 = 40960 Mo)
sudo sysctl iogpu.wired_limit_mb=40960

#Qual modelo para qual memória: o que cabe em um Mac mini

A tabela cruza o tamanho dos arquivos publicados pelo Ollama com um limite de dois terços da RAM (hipótese prudente). “Sim”: os pesos ocupam menos de 70% do limite, e sobra espaço para o cache KV. “No limite”: eles cabem, com um contexto curto. “Não”: eles excedem o limite. São cálculos, não medições.

Quantização padrão do Ollama, salvo indicação em contrário: o modelo cabe no limite padrão de memória utilizável pela GPU?
ModeloPeso (Ollama)M4 16 GBM4 24 GBM4 32 GBM4 Pro 48 GBM4 Pro 64 GB
Qwen 3.5 9B6,6 GBsimsimsimsimsim
Gemma 4 12B7,6 GBapenassimsimsimsim
gpt-oss 20B14 GBnãoapenassimsimsim
Mistral Small 24B14 GBnãoapenassimsimsim
Qwen 3.8 27B18 GBnãonãoapenassimsim
Qwen3-Coder 30B-A3B19 GBnãonãoapenassimsim
Qwen 3.6 35B-A3B (MoE)23 GBnãonãonãoapenassim
Qwen3-Coder 30B-A3B em Q8_032 GBnãonãonãoapenasapenas

#Mac mini M4 16 GB: os modelos a preferir

Com 16 GB, o limite fica em torno de 11 GB. Qwen 3.5 9B (6,6 GB no Ollama) deixa cerca de 4 GB para o cache KV e os buffers. Gemma 4 12B (7,6 GB) funciona com um contexto curto. Um modelo de 14 GB como Mistral Small 24B excede esse limite: o Ollama o distribui entre GPU e CPU, e a velocidade cai. O comando ollama ps mostra a distribuição; procure manter a execução 100% na GPU.

→
Um MoE reduz o tempo por token, não a memória
Qwen3-Coder 30B-A3B conta com 30,5 bilhões de parâmetros ao todo, mas 3,3 bilhões ativos por token: ele lê poucos pesos e é rápido, mas todo o arquivo (19 GB) permanece na memória. Por isso, não cabe em um Mac mini de 16 GB, apesar de ter 3 bilhões ativos.

#Velocidade de um Mac mini: limite teórico e medições publicadas

A taxa de geração é limitada pela largura de banda: tokens por segundo ≈ largura de banda (GB/s) ÷ pesos lidos a cada token (GB). Esse cálculo fornece um limite teórico, nunca uma medição real. Para um modelo denso de 14 GB, 120 ÷ 14 dá 8,6 tokens/s no máximo em um M4, e 273 ÷ 14 dá 19,5 em um M4 Pro.

Limite teórico em tokens/s (largura de banda ÷ tamanho do modelo no Ollama, modelos densos)
ModeloTamanho do modeloM4 (120 GB/s)M4 Pro (273 GB/s)
Qwen 3.5 9B6,6 GB1841
Gemma 4 12B7,6 GB1636
Mistral Small 24B14 GB8,619,5

As medições publicadas ficam abaixo desse limite. A seguir estão as medições da tabela que a comunidade llama.cpp mantém atualizada para os chips Apple, com Llama 2 7B. Não são nossas medições e se referem a um modelo antigo em Q4_0 e Q8_0, mas mostram a relação entre os chips.

llama.cpp, Llama 2 7B: tokens/s (discussão no GitHub 4167, commit 8e672ef)
ChipLargura de bandaGeração Q4_0Geração Q8_0Prompt Q4_0
M4 (GPU com 10 núcleos)120 GB/s24,113,5221
M4 Pro (GPU de 16 núcleos)273 GB/s49,630,5364
M4 Pro (GPU com 20 núcleos)273 GB/s50,730,7440
M5 Pro (GPU com 20 núcleos)307 GB/s66,338,91 621

Passar de Q8_0 para Q4_0 acelera a geração em 1,8x no M4 e 1,7x no M4 Pro: o tamanho do arquivo conta mais que o cálculo. Os núcleos GPU têm maior impacto na leitura do prompt (364 contra 440 tokens/s no M4 Pro). A tabela não contém nenhuma medição para o M6 na data de consulta.

i
Um modelo de raciocínio demora para responder
Um modelo que raciocina geralmente gera 2.000 tokens antes de responder. A 8 tokens/s (um modelo denso de 14B no M4), isso dá 250 segundos, mais de 4 minutos. A 19 tokens/s no M4 Pro, cerca de 105 segundos. Esse cálculo influencia a escolha entre M4 e M4 Pro.

#Mac mini M6 e M5 Pro: o que a nova linha muda para um LLM

A Apple anuncia para o Mac mini M6 uma velocidade de processamento do prompt no LM Studio até 4,8 vezes maior que a do M4, e para o M5 Pro até 4 vezes maior que a do M4 Pro. Esses ganhos se referem à leitura do prompt, que aproveita os aceleradores neurais adicionados a cada núcleo da GPU. A geração continua determinada pela largura de banda e melhora bem menos: de 12% (307 contra 273 GB/s) a 42% (170 contra 120 GB/s).

Os quatro chips (fonte: Apple)
ChipLargura de bandaMemória unificadaRepouso / máximo
M4120 GB/s16, 24 ou 32 GB4 W / 65 W
M6153 GB/s (16 GB), 170 GB/s (24 GB e mais)16, 24 ou 32 GB4 W / 70 W
M4 Pro273 GB/s24, 48 ou 64 GB5 W / 140 W
M5 Pro307 GB/s24, 48 ou 64 GB6 W / 145 W

Um M6 básico com 153 GB/s tem apenas 28% mais largura de banda do que o M4: o limite teórico de um 9B passa de 18 para cerca de 23 tokens/s. A nova linha beneficia principalmente os usos com contexto longo: um RAG que injeta documentos longos, um agente de código que relê um repositório.

Máquina nova, modelo de 30 a 35 bilhões de parâmetros
Um M5 Pro com pelo menos 48 GB, 64 GB para se sentir confortável com um MoE de 35 bilhões: o M6 atinge apenas 32 GB.
M4 ainda em estoque
Coerente para 7 a 12 bilhões de parâmetros, se houver uma diferença de preço clara em relação ao M6. Este estoque é limitado.

#Instalar um servidor LLM em um Mac mini com Ollama

O Ollama no macOS funciona como um aplicativo, cujas configurações são feitas por meio de variáveis de ambiente definidas com launchctl. Por padrão, o Ollama escuta apenas em 127.0.0.1, na porta 11434: sem alterações, nenhum outro dispositivo pode usá-lo.

  1. 01
    Instalar o aplicativo Ollama
    Baixe o Ollama de ollama.com e coloque o aplicativo na pasta Aplicativos. Na primeira execução, ele oferece criar o link do comando ollama.
  2. 02
    Abrir a porta para a rede local
    Defina OLLAMA_HOST com launchctl (comando abaixo), depois reinicie o aplicativo. O endereço 0.0.0.0 abre a API para toda a rede, sem autenticação: use esse endereço apenas em uma rede de confiança.
  3. 03
    Impedir a suspensão
    Em Configurações do Sistema, na seção Energia, ative a opção que impede a suspensão automática quando a tela está apagada: sem ela, o serviço pode ser interrompido.
  4. 04
    Baixar um modelo adequado
    Escolha, no quadro, um modelo marcado "sim" para sua memória, por exemplo qwen3.5:9b em 16 GB.
  5. 05
    Verificar a partir de outro dispositivo
    Envie uma requisição para o endereço do Mac mini (nome .local ou IP), depois execute ollama ps: a coluna Processor deve exibir 100% GPU.
Servidor Ollama no Mac mini
# Écoute sur tout le réseau local, puis relancer l'application Ollama
launchctl setenv OLLAMA_HOST "0.0.0.0:11434"

# Modèle pour 16 Go de mémoire
ollama pull qwen3.5:9b

# Test depuis un autre appareil (remplacez l'adresse)
curl http://mac-mini.local:11434/api/chat -d '{"model": "qwen3.5:9b", "messages": [{"role": "user", "content": "Bonjour"}], "stream": false}'

Dois ajustes frequentemente copiados são inúteis aqui: a documentação do Ollama esclarece que o Flash Attention é ativado automaticamente quando o hardware permite, e OLLAMA_ORIGINS diz respeito às extensões de navegador. Por outro lado, quantizar o cache KV (OLLAMA_KV_CACHE_TYPE=q8_0) reduz seu tamanho aproximadamente pela metade com uma perda muito pequena, o que faz diferença em uma máquina com 16 GB quando o contexto aumenta.

#LM Studio: a alternativa ao Ollama

O LM Studio exige um chip Apple Silicon e macOS 14 ou mais recente, com 16 GB de RAM recomendados. Desde a versão 0.3.4, ele carrega tanto modelos GGUF quanto MLX. Sem tela, seu daemon llmster é iniciado com lms daemon up. A opção “Serve on Local Network” disponibiliza a API na rede; a autenticação por token não é ativada por padrão. O mecanismo MLX do Ollama, apresentado em versão preliminar em março de 2026, exigia mais de 32 GB: um M4 com 16 GB não podia se beneficiar dele.

#O que um Mac mini pode oferecer: chat, RAG, agentes, cluster

Servidor de chat em casa
As APIs do Ollama e do LM Studio aceitam clientes no formato OpenAI (Open WebUI, Zed, scripts). Colocado perto do roteador, o Mac mini atende toda a casa.
RAG documental
É necessário carregar o modelo de geração e um modelo de embeddings. nomic-embed-text pesa 274 MB: em 16 GB, cabe ao lado de Qwen 3.5 9B.
Agente de código
Um agente envia prompts longos em cada etapa: a leitura do prompt conta mais do que a geração, e é aqui que M6 e M5 Pro ganham mais.

#Quantos usuários simultâneos?

Ollama processa uma requisição de cada vez por modelo por padrão (OLLAMA_NUM_PARALLEL vale 1). Cada requisição paralela aumenta o contexto alocado: de acordo com a documentação, 4 requisições com um contexto de 2.000 tokens alocam 8.000 tokens. Memória do cache = cache de uma conversa × requisições paralelas. Cada pessoa recebe sua resposta mais lentamente; não existe aqui uma medição confiável para um número específico de pessoas.

#Ligar vários Mac mini em cluster

Somente o M4 Pro oferece Thunderbolt 5 (120 Gb/s); o M4 se limita a Thunderbolt 4 (40 Gb/s). O projeto exo oferece suporte a RDMA via Thunderbolt 5, que reduziria em 99% a latência entre máquinas, e afirma acelerar os modelos à medida que se adicionam dispositivos, com macOS 26.2 ou superior. Seus benchmarks foram realizados em Mac Studio, não em Mac mini. Um cluster serve principalmente para carregar um modelo grande demais para uma única máquina.

#Mac mini M4 ou MacBook Air M4: mesmo chip, uso diferente

O MacBook Air de 13 polegadas com M4 utiliza o mesmo chip, com a mesma largura de banda (120 GB/s) e as mesmas opções de 16, 24 ou 32 GB: a velocidade máxima é a mesma. O que muda é o chassi. A versão antiga deste guia indicava uma redução de 20% no desempenho do Air após dez minutos; nenhuma fonte confirma essa redução, e essa afirmação foi retirada. Para um serviço ligado continuamente, o Mac mini é a escolha natural; para um computador portátil (1,24 kg, tela e bateria incluídos), o MacBook.

#Perguntas frequentes

Um Mac mini M4 com 16 GB é suficiente para um LLM local?+
Sim, para modelos com 7 a 12 bilhões de parâmetros. O Qwen 3.5 9B (6,6 GB) cabe no limite de GPU de aproximadamente 11 GB com um contexto razoável. Na melhor das hipóteses, espere cerca de vinte tokens/s: o M4 tem um limite de 120 GB/s. Acima de 12 bilhões de parâmetros, use 24 GB ou um M4 Pro.
Qual o melhor LLM para um Mac mini M4 de 16 GB?+
Qwen 3.5 9B é a opção mais segura: com 6,6 GB no Ollama, deixa espaço para o cache KV. Gemma 4 12B (7,6 GB) funciona com contexto curto. Evite modelos de 14 GB ou mais: eles passam a ser executados parcialmente na CPU e perdem velocidade.
Mac mini M4 ou M4 Pro para IA local?+
O M4 Pro, se você busca modelos com mais de 12 bilhões de parâmetros: seus 273 GB/s contra 120 GB/s praticamente dobram a taxa de geração, e suas opções de 48 e 64 GB permitem rodar modelos MoE de 30 a 35 bilhões de parâmetros. Para um modelo de 9B usado por uma só pessoa, o M4 é suficiente.
O Mac mini M6 é muito mais rápido que o M4 para um LLM?+
Para leitura do prompt, sim: a Apple anuncia até 4,8 vezes mais velocidade no LM Studio. Para geração, não: a largura de banda passa de 120 para 153 GB/s no M6 básico, ou seja, cerca de 28% a mais. As respostas curtas mudam pouco; os contextos longos, muito.
É possível ligar vários Mac mini em cluster para um LLM?+
Sim, com uma ferramenta como exo, especialmente para carregar um modelo muito grande para uma única máquina. O M4 Pro oferece Thunderbolt 5 (120 Gb/s), o M4 apenas Thunderbolt 4 (40 Gb/s). Os ganhos publicados por exo referem-se a Mac Studio: verifique na sua configuração.
Quanto consome um Mac mini M4 como servidor LLM 24 h/24?+
A Apple anuncia 4 W em repouso e 65 W no máximo para o M4 (5 W e 140 W para o M4 Pro). Em repouso contínuo, 4 W × 8 760 h dão aproximadamente 35 kWh por ano; multiplique pela sua tarifa por kWh. Durante a inferência, a Apple não divulga um valor: um medidor de consumo conectado à tomada mostra o valor real.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.