Iniciante 11 miniMac

Qual LLM para iMac M4 (16 / 24 / 32 GB) ?

Resposta direta

O iMac M4 executa confortavelmente modelos de 8 a 14 bilhões de parâmetros em Q4: seu chip M4 oferece 120 GB/s de largura de banda de memória, e uma medição pública indica 24 tokens por segundo em um modelo de 7B em Q4_0 com a GPU de 10 núcleos. A memória unificada (16, 24 ou 32 GB) define o tamanho máximo: 16 GB para um modelo de 14B, 24 GB para um modelo de 24B lento, 32 GB para um modelo de 30B ainda mais lento.

Um iMac é antes de tudo uma tela; para a IA local, é principalmente um chip M4 e uma quantidade de memória unificada que não poderá mais ser alterada. Este guia quantifica o que cada configuração permite executar, a que velocidade segundo as medições públicas e em quais casos um Mac mini é a melhor compra.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no macOS 14+
Hardware recomendado

Para este setup: iMac M4 — 16 GB / 256 GB.

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#O que o iMac M4 faz para a IA local

O iMac M4 executa bem modelos com 8 a 14 bilhões de parâmetros e aceita modelos maiores com velocidade reduzida. Três números resumem o essencial. O chip M4 fornece 120 GB/s de largura de banda de memória, segundo a ficha técnica da Apple, o que representa um limite teórico de aproximadamente 31 tokens por segundo em um modelo de 7B em Q4_0. A medição pública do repositório llama.cpp em um M4 com GPU de 10 núcleos indica 24,11 tokens por segundo na geração, ou seja, 77% desse limite. Por fim, a memória unificada vai de 16 a 32 GB e é escolhida na compra: ela, por si só, determina o tamanho possível do modelo. O que falta nesse iMac é largura de banda, não capacidade.

Chip
Apple M4; a ficha técnica da Apple não oferece uma variante Pro ou Max para o iMac.
Largura de banda
120 GB/s, independentemente da configuração.
Memória unificada
16 GB na configuração básica; 24 GB como opção em todas as versões, 32 GB no modelo com 4 portas.
Tela
24 polegadas 4,5K (4480 × 2520), o que torna uma GPU maior pouco vantajosa: a limitação é a memória.
Preço
Não indicado aqui: a Apple altera os preços; veja a página de hardware do site.

#As configurações reais: dois modelos, não três

O kit Mac

IA local no seu Mac, a fundo: memória unificada, MLX vs GGUF, o modelo certo para seu chip, Ollama e LM Studio ajustados para Apple Silicon.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

A página da Apple distingue duas famílias. O modelo com 2 portas tem uma CPU de 8 núcleos e uma GPU de 8 núcleos, com 16 GB de memória, configuráveis para 24 GB. O modelo com 4 portas tem uma CPU de 10 núcleos e uma GPU de 10 núcleos, com 16 GB de memória, configuráveis para 24 ou 32 GB. A largura de banda de 120 GB/s é idêntica. Um erro comum, presente na versão antiga desta página, é acreditar que ainda existe uma configuração de 8 GB: a memória básica é de 16 GB. Para um LLM, portanto, o importante é optar pelo modelo com 4 portas se você quiser 32 GB.

Configurações do iMac M4 úteis para um LLM (ficha técnica da Apple)
VersãoGPUMemória unificadaLargura de banda
2 portas8 núcleos16 GB, opção 24 GB120 GB/s
4 portas10 núcleos16 GB, com opções de 24 e 32 GB120 GB/s

Para a geração de texto, a diferença entre 8 e 10 núcleos de GPU é provavelmente pequena: a velocidade depende da largura de banda, que é a mesma. Não há nenhuma medição pública na tabela de referência para a variante com 8 núcleos, então essa afirmação continua sendo uma hipótese. Se você estiver em dúvida, prefira investir em memória em vez de núcleos.

#16, 24 ou 32 GB: a memória disponível

Em um Mac, a memória é compartilhada entre o sistema e a GPU, e o macOS disponibiliza apenas uma fração dela à GPU. A configuração iogpu.wired_limit_mb vale 0 por padrão, o que significa que o kernel determina o limite com base na memória instalada. Em um Mac de 32 GB medido pelo ModelPiper, o Metal disponibilizava 24,96 GiB à GPU, ou seja, 78% da memória. Costuma-se citar 75%. Para um iMac, portanto, conte com cerca de 11 a 12 GB em uma versão com 16 GB de memória, 17 a 18 GB em uma versão com 24 GB e 24 a 25 GB em uma versão com 32 GB: são estimativas, que devem ser verificadas na sua máquina com o comando sysctl iogpu.wired_limit_mb e a ferramenta Metal descrita pelo ModelPiper.

Memória disponível para o modelo (estimativa de 75 %)
ConfiguraçãoMemória utilizável pela GPUMaior modelo razoável
16 GB≈ 11 a 12 GBUm 14B em Q4 (≈ 9 GB), contexto médio
24 GB≈ 17 a 18 GBUm 24B em Q4 (≈ 14 GB), contexto curto
32 GB≈ 24 a 25 GBUm modelo de 30B em Q4 (≈ 17 a 18 GB), contexto médio

Para ir além dessas limitações, é possível aumentar a parte atribuída à GPU. O guia sobre otimização de Macs com Apple Silicon detalha esse ajuste e seus riscos; não o repetimos aqui.

#Quais modelos para cada capacidade de memória

Os pesos em Q4 abaixo vêm do catálogo QuelLLM. Eles pressupõem que o modelo cabe na memória utilizável da tabela anterior, incluindo o contexto. A coluna "fluidez" aplica o limite de 120 GB/s a cada modelo: são ordens de grandeza calculadas, não medições.

Modelos por configuração de memória (Q4, apenas os pesos)
ModeloTamanho do modeloConfiguração mínimaFluidez esperada no M4
Llama 3.1 8B≈ 6 GB16 GBFluido (cerca de 15 tokens/s)
Gemma 4 12B≈ 7 GB16 GBRazoável (cerca de 13 tokens/s)
Phi-4 14B≈ 9 GB16 GBRazoável (cerca de 10 tokens/s)
gpt-oss 20B≈ 13 GB24 GBVariável (MoE: mais rápido que um denso de 20B)
Devstral Small 2 24B≈ 14 GB24 GBLento (cerca de 6 a 7 tokens/s)
Gemma 4 31B≈ 18 GB32 GBMuito lento (cerca de 5 tokens/s)

A regra é não confundir “cabe na memória” com “é agradável de usar”. Um modelo denso de 24B no M4 básico ainda gera texto em um ritmo que permite a leitura, mas é lento, com algumas palavras por segundo, enquanto um modelo com especialistas (MoE), como gpt-oss 20B ou Gemma 4 26B-A4B, lê apenas alguns bilhões de parâmetros a cada token e, por isso, supera um modelo denso de tamanho comparável. Para um iMac com 24 ou 32 GB, um MoE costuma ser a melhor escolha.

Uma escolha recorrente em máquinas com 24 GB é entre um modelo de 12B em Q8 (aproximadamente 13 GB) e um de 24B em Q4 (aproximadamente 14 GB). Os dois ocupam quase a mesma quantidade de memória, portanto geram tokens aproximadamente à mesma velocidade, em torno de 7 tokens por segundo, conforme o limite de largura de banda. O segundo oferece maior capacidade de raciocínio, enquanto o primeiro mantém maior fidelidade ao modelo original. Com a mesma largura de banda, é o tamanho do modelo em gigabytes que determina a taxa de geração, e não o número de parâmetros.

#Velocidade: a largura de banda decide

A única medição pública de referência é a tabela do repositório llama.cpp para Apple Silicon, que testa um LLaMA 7B em Q4_0. Para um M4 com GPU de 10 núcleos e 120 GB/s, a tabela indica 221,29 tokens por segundo na leitura do prompt e 24,11 na geração. Um M4 Pro com 273 GB/s e GPU de 16 núcleos apresenta 49,64 na geração, ou seja, um pouco mais do dobro. Essa proporção é próxima da proporção entre as larguras de banda (2,3 vezes): é sinal de que a geração depende da memória, e não do número de núcleos da GPU.

Apple Silicon com LLaMA 7B Q4_0 (discussão do llama.cpp)
ChipGPULargura de bandaGeração tg (t/s)
M4 (iMac 4 portas)10 núcleos120 GB/s24,11
M4 Pro (Mac mini M4 Pro)16 núcleos273 GB/s49,64

Essas medições datam de uma versão inicial do llama.cpp; as versões recentes e o MLX podem ter resultados melhores. Considere-as como uma ordem de grandeza. A versão anterior desta página anunciava 28 a 31 tokens por segundo para um 9B em Q5: esse valor ultrapassaria o limite de 120 GB/s para um modelo desse tamanho, e nós o removemos.

#Três usos realistas de acordo com a memória

Um orçamento de memória fica mais fácil de entender quando aplicado a um uso concreto. Em cada caso, some o espaço ocupado pelo modelo, pelo cache do contexto e pelos outros programas abertos, e compare o total com a memória utilizável indicada na tabela anterior. A calculadora do site faz essa soma para você; basta entender a lógica.

Usos típicos e configuração recomendada
UsoO que precisa ser carregadoConfiguração mínima
Assistente de escritório: resumos, e-mails, traduçãoUm 8B ou um 12B em Q4, contexto de alguns milhares de tokens16 GB
Pesquisa em seus documentos (RAG)Um modelo de geração de 12B, um modelo de embeddings e um reranker carregados juntos24 GB para manter uma margem
Ajuda na programação em projetos de médio porteUm 24B (Devstral Small 2) ou um MoE de 20 a 26B, contexto longo24 GB, 32 GB se o contexto crescer

Sobre calor e barulho, não encontramos nenhuma medição pública de um iMac M4 sob carga de LLM sustentada, e portanto não fazemos nenhuma afirmação sobre seu ventilador. O único indicativo confiável é o uso: se a geração durar horas, monitore a frequência e a temperatura no Monitor de Atividade e mantenha um contexto razoável.

#Configuração inicial

  1. 01
    Verificar a memória
    Anote a memória do seu iMac no menu Apple, depois Sobre este Mac. Ela define a lista de modelos possíveis.
  2. 02
    Instalar Ollama ou LM Studio
    Ollama acelera os cálculos em GPUs da Apple via a API Metal. O LM Studio oferece uma interface gráfica bem adaptada para grandes telas.
  3. 03
    Carregar um modelo adequado
    Escolha um modelo da tabela de acordo com a memória disponível, em Q4_K_M, e execute-o com ollama run.
  4. 04
    Verificar o uso da GPU
    Use ollama ps para verificar se o modelo está carregado na GPU e, depois, o Monitor de Atividade para acompanhar a pressão da memória.
  5. 05
    Limitar o contexto
    Em 16 GB, mantenha um contexto de alguns milhares de tokens para evitar que o sistema faça swap.
Terminal
ollama ps
sysctl iogpu.wired_limit_mb
sysctl hw.memsize

#iMac M4 ou Mac mini M4: o verdadeiro critério

O Mac mini M4 utiliza o mesmo chip e a mesma largura de banda; com a mesma quantidade de memória, o iMac não é, portanto, mais lento. O que muda é a tela integrada, que não pode ser substituída, e a ausência de uma variante Pro: o iMac fica limitado a 32 GB e 120 GB/s, enquanto o Mac mini M4 Pro chega a 273 GB/s, segundo a mesma discussão de referência. Se seu objetivo é um modelo de 24B ou mais com velocidade adequada, a largura de banda do Mac mini M4 Pro dobra a taxa de processamento; se for um assistente de desktop com um modelo de 8 a 14B, o iMac é equivalente.

iMac M4 ou Mac mini
CritérioiMac M4Mac mini M4 / M4 Pro
Largura de banda120 GB/s120 GB/s (M4); 273 GB/s (M4 Pro)
Memória máxima32 GBVeja a página do Mac mini
TelaIntegrado 4,5K de 24 polegadasEscolher separadamente
Velocidade medida 7B Q4_024,11 t/s24,11 t/s (M4); 49,64 t/s (M4 Pro)
EscalabilidadeNenhuma, memória não substituívelO mesmo se aplica à memória, tela substituível
→
O critério decisivo
Escolha o iMac se você quer um computador tudo-em-um e um assistente de 8 a 14B. Escolha um Mac mini M4 Pro se você busca um modelo de 24B ou mais, caso em que a largura de banda dobra a taxa de geração. Os preços mudam: confira-os nas páginas de hardware do site.

#Perguntas frequentes

FAQ
O iMac M4 é bom para IA local?+
Sim para modelos com 8 a 14 bilhões de parâmetros: o chip M4 oferece 120 GB/s de largura de banda e uma medição pública indica 24 tokens por segundo em um modelo 7B em Q4_0. Ele fica significativamente mais lento com modelos de 24B ou mais, por falta de largura de banda, não de capacidade.
16, 24 ou 32 GB em um iMac M4 para um LLM?+
Dezesseis GB são suficientes para um modelo de 8B a 14B em Q4, com cerca de 11 a 12 GB utilizáveis. Vinte e quatro GB permitem usar modelos de 20B a 24B, e trinta e dois GB, modelos de 30B em Q4. Como a memória não pode ser substituída após a compra, mire no maior modelo que você pretende usar, não no de hoje.
Qual a velocidade de um LLM no iMac M4?+
Em um M4 com GPU de 10 núcleos, a tabela do llama.cpp mostra 24,11 tokens por segundo na geração com um LLaMA 7B em Q4_0. O cálculo da largura de banda dividida pelo tamanho dos pesos sugere cerca de 15 tokens por segundo para um modelo 8B recente em Q4 e de 6 a 7 para um modelo 24B denso: estimativas a verificar.
Por que não existe um iMac M4 Pro?+
A página da Apple oferece apenas o chip M4 para o iMac, nas versões com 8 e 10 núcleos de GPU. Para maior largura de banda, é necessário passar para um Mac mini M4 Pro (273 GB/s), cuja geração é mais de duas vezes mais rápida conforme indicado na tabela de referência.
O iMac M4 com 8 núcleos de GPU é suficiente para um LLM?+
Provavelmente sim: com 120 GB/s em todas as variantes, a geração depende pouco do número de núcleos da GPU. Não há nenhuma medição na tabela do llama.cpp para a variante com 8 núcleos, então isso é uma hipótese. Escolha principalmente com base na memória: 24 GB é o primeiro patamar realmente útil.
O Ollama utiliza a GPU do iMac M4?+
Sim: a documentação do Ollama indica que ele acelera os cálculos nas GPUs da Apple via a API Metal. Verifique com o comando ollama ps se o modelo está carregado na GPU e monitore a pressão de memória no Monitor de Atividade se você estiver se aproximando do limite da sua configuração.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.