Qual LLM para iMac M4 (16 / 24 / 32 GB) ?
O iMac M4 executa confortavelmente modelos de 8 a 14 bilhões de parâmetros em Q4: seu chip M4 oferece 120 GB/s de largura de banda de memória, e uma medição pública indica 24 tokens por segundo em um modelo de 7B em Q4_0 com a GPU de 10 núcleos. A memória unificada (16, 24 ou 32 GB) define o tamanho máximo: 16 GB para um modelo de 14B, 24 GB para um modelo de 24B lento, 32 GB para um modelo de 30B ainda mais lento.
Um iMac é antes de tudo uma tela; para a IA local, é principalmente um chip M4 e uma quantidade de memória unificada que não poderá mais ser alterada. Este guia quantifica o que cada configuração permite executar, a que velocidade segundo as medições públicas e em quais casos um Mac mini é a melhor compra.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Para este setup: iMac M4 — 16 GB / 256 GB.
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#O que o iMac M4 faz para a IA local
O iMac M4 executa bem modelos com 8 a 14 bilhões de parâmetros e aceita modelos maiores com velocidade reduzida. Três números resumem o essencial. O chip M4 fornece 120 GB/s de largura de banda de memória, segundo a ficha técnica da Apple, o que representa um limite teórico de aproximadamente 31 tokens por segundo em um modelo de 7B em Q4_0. A medição pública do repositório llama.cpp em um M4 com GPU de 10 núcleos indica 24,11 tokens por segundo na geração, ou seja, 77% desse limite. Por fim, a memória unificada vai de 16 a 32 GB e é escolhida na compra: ela, por si só, determina o tamanho possível do modelo. O que falta nesse iMac é largura de banda, não capacidade.
- Chip
- Apple M4; a ficha técnica da Apple não oferece uma variante Pro ou Max para o iMac.
- Largura de banda
- 120 GB/s, independentemente da configuração.
- Memória unificada
- 16 GB na configuração básica; 24 GB como opção em todas as versões, 32 GB no modelo com 4 portas.
- Tela
- 24 polegadas 4,5K (4480 × 2520), o que torna uma GPU maior pouco vantajosa: a limitação é a memória.
- Preço
- Não indicado aqui: a Apple altera os preços; veja a página de hardware do site.
#As configurações reais: dois modelos, não três
IA local no seu Mac, a fundo: memória unificada, MLX vs GGUF, o modelo certo para seu chip, Ollama e LM Studio ajustados para Apple Silicon.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
A página da Apple distingue duas famílias. O modelo com 2 portas tem uma CPU de 8 núcleos e uma GPU de 8 núcleos, com 16 GB de memória, configuráveis para 24 GB. O modelo com 4 portas tem uma CPU de 10 núcleos e uma GPU de 10 núcleos, com 16 GB de memória, configuráveis para 24 ou 32 GB. A largura de banda de 120 GB/s é idêntica. Um erro comum, presente na versão antiga desta página, é acreditar que ainda existe uma configuração de 8 GB: a memória básica é de 16 GB. Para um LLM, portanto, o importante é optar pelo modelo com 4 portas se você quiser 32 GB.
| Versão | GPU | Memória unificada | Largura de banda |
|---|---|---|---|
| 2 portas | 8 núcleos | 16 GB, opção 24 GB | 120 GB/s |
| 4 portas | 10 núcleos | 16 GB, com opções de 24 e 32 GB | 120 GB/s |
Para a geração de texto, a diferença entre 8 e 10 núcleos de GPU é provavelmente pequena: a velocidade depende da largura de banda, que é a mesma. Não há nenhuma medição pública na tabela de referência para a variante com 8 núcleos, então essa afirmação continua sendo uma hipótese. Se você estiver em dúvida, prefira investir em memória em vez de núcleos.
#16, 24 ou 32 GB: a memória disponível
Em um Mac, a memória é compartilhada entre o sistema e a GPU, e o macOS disponibiliza apenas uma fração dela à GPU. A configuração iogpu.wired_limit_mb vale 0 por padrão, o que significa que o kernel determina o limite com base na memória instalada. Em um Mac de 32 GB medido pelo ModelPiper, o Metal disponibilizava 24,96 GiB à GPU, ou seja, 78% da memória. Costuma-se citar 75%. Para um iMac, portanto, conte com cerca de 11 a 12 GB em uma versão com 16 GB de memória, 17 a 18 GB em uma versão com 24 GB e 24 a 25 GB em uma versão com 32 GB: são estimativas, que devem ser verificadas na sua máquina com o comando sysctl iogpu.wired_limit_mb e a ferramenta Metal descrita pelo ModelPiper.
| Configuração | Memória utilizável pela GPU | Maior modelo razoável |
|---|---|---|
| 16 GB | ≈ 11 a 12 GB | Um 14B em Q4 (≈ 9 GB), contexto médio |
| 24 GB | ≈ 17 a 18 GB | Um 24B em Q4 (≈ 14 GB), contexto curto |
| 32 GB | ≈ 24 a 25 GB | Um modelo de 30B em Q4 (≈ 17 a 18 GB), contexto médio |
Para ir além dessas limitações, é possível aumentar a parte atribuída à GPU. O guia sobre otimização de Macs com Apple Silicon detalha esse ajuste e seus riscos; não o repetimos aqui.
- Extrair o máximo de um Mac Apple Silicon: ajustes do macOS
- Calculadora de memória para um modelo e um contexto dados
#Quais modelos para cada capacidade de memória
Os pesos em Q4 abaixo vêm do catálogo QuelLLM. Eles pressupõem que o modelo cabe na memória utilizável da tabela anterior, incluindo o contexto. A coluna "fluidez" aplica o limite de 120 GB/s a cada modelo: são ordens de grandeza calculadas, não medições.
| Modelo | Tamanho do modelo | Configuração mínima | Fluidez esperada no M4 |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | 16 GB | Fluido (cerca de 15 tokens/s) |
| Gemma 4 12B | ≈ 7 GB | 16 GB | Razoável (cerca de 13 tokens/s) |
| Phi-4 14B | ≈ 9 GB | 16 GB | Razoável (cerca de 10 tokens/s) |
| gpt-oss 20B | ≈ 13 GB | 24 GB | Variável (MoE: mais rápido que um denso de 20B) |
| Devstral Small 2 24B | ≈ 14 GB | 24 GB | Lento (cerca de 6 a 7 tokens/s) |
| Gemma 4 31B | ≈ 18 GB | 32 GB | Muito lento (cerca de 5 tokens/s) |
A regra é não confundir “cabe na memória” com “é agradável de usar”. Um modelo denso de 24B no M4 básico ainda gera texto em um ritmo que permite a leitura, mas é lento, com algumas palavras por segundo, enquanto um modelo com especialistas (MoE), como gpt-oss 20B ou Gemma 4 26B-A4B, lê apenas alguns bilhões de parâmetros a cada token e, por isso, supera um modelo denso de tamanho comparável. Para um iMac com 24 ou 32 GB, um MoE costuma ser a melhor escolha.
Uma escolha recorrente em máquinas com 24 GB é entre um modelo de 12B em Q8 (aproximadamente 13 GB) e um de 24B em Q4 (aproximadamente 14 GB). Os dois ocupam quase a mesma quantidade de memória, portanto geram tokens aproximadamente à mesma velocidade, em torno de 7 tokens por segundo, conforme o limite de largura de banda. O segundo oferece maior capacidade de raciocínio, enquanto o primeiro mantém maior fidelidade ao modelo original. Com a mesma largura de banda, é o tamanho do modelo em gigabytes que determina a taxa de geração, e não o número de parâmetros.
#Velocidade: a largura de banda decide
A única medição pública de referência é a tabela do repositório llama.cpp para Apple Silicon, que testa um LLaMA 7B em Q4_0. Para um M4 com GPU de 10 núcleos e 120 GB/s, a tabela indica 221,29 tokens por segundo na leitura do prompt e 24,11 na geração. Um M4 Pro com 273 GB/s e GPU de 16 núcleos apresenta 49,64 na geração, ou seja, um pouco mais do dobro. Essa proporção é próxima da proporção entre as larguras de banda (2,3 vezes): é sinal de que a geração depende da memória, e não do número de núcleos da GPU.
| Chip | GPU | Largura de banda | Geração tg (t/s) |
|---|---|---|---|
| M4 (iMac 4 portas) | 10 núcleos | 120 GB/s | 24,11 |
| M4 Pro (Mac mini M4 Pro) | 16 núcleos | 273 GB/s | 49,64 |
Essas medições datam de uma versão inicial do llama.cpp; as versões recentes e o MLX podem ter resultados melhores. Considere-as como uma ordem de grandeza. A versão anterior desta página anunciava 28 a 31 tokens por segundo para um 9B em Q5: esse valor ultrapassaria o limite de 120 GB/s para um modelo desse tamanho, e nós o removemos.
#Três usos realistas de acordo com a memória
Um orçamento de memória fica mais fácil de entender quando aplicado a um uso concreto. Em cada caso, some o espaço ocupado pelo modelo, pelo cache do contexto e pelos outros programas abertos, e compare o total com a memória utilizável indicada na tabela anterior. A calculadora do site faz essa soma para você; basta entender a lógica.
| Uso | O que precisa ser carregado | Configuração mínima |
|---|---|---|
| Assistente de escritório: resumos, e-mails, tradução | Um 8B ou um 12B em Q4, contexto de alguns milhares de tokens | 16 GB |
| Pesquisa em seus documentos (RAG) | Um modelo de geração de 12B, um modelo de embeddings e um reranker carregados juntos | 24 GB para manter uma margem |
| Ajuda na programação em projetos de médio porte | Um 24B (Devstral Small 2) ou um MoE de 20 a 26B, contexto longo | 24 GB, 32 GB se o contexto crescer |
Sobre calor e barulho, não encontramos nenhuma medição pública de um iMac M4 sob carga de LLM sustentada, e portanto não fazemos nenhuma afirmação sobre seu ventilador. O único indicativo confiável é o uso: se a geração durar horas, monitore a frequência e a temperatura no Monitor de Atividade e mantenha um contexto razoável.
#Configuração inicial
- 01Verificar a memóriaAnote a memória do seu iMac no menu Apple, depois Sobre este Mac. Ela define a lista de modelos possíveis.
- 02Instalar Ollama ou LM StudioOllama acelera os cálculos em GPUs da Apple via a API Metal. O LM Studio oferece uma interface gráfica bem adaptada para grandes telas.
- 03Carregar um modelo adequadoEscolha um modelo da tabela de acordo com a memória disponível, em Q4_K_M, e execute-o com ollama run.
- 04Verificar o uso da GPUUse ollama ps para verificar se o modelo está carregado na GPU e, depois, o Monitor de Atividade para acompanhar a pressão da memória.
- 05Limitar o contextoEm 16 GB, mantenha um contexto de alguns milhares de tokens para evitar que o sistema faça swap.
#iMac M4 ou Mac mini M4: o verdadeiro critério
O Mac mini M4 utiliza o mesmo chip e a mesma largura de banda; com a mesma quantidade de memória, o iMac não é, portanto, mais lento. O que muda é a tela integrada, que não pode ser substituída, e a ausência de uma variante Pro: o iMac fica limitado a 32 GB e 120 GB/s, enquanto o Mac mini M4 Pro chega a 273 GB/s, segundo a mesma discussão de referência. Se seu objetivo é um modelo de 24B ou mais com velocidade adequada, a largura de banda do Mac mini M4 Pro dobra a taxa de processamento; se for um assistente de desktop com um modelo de 8 a 14B, o iMac é equivalente.
| Critério | iMac M4 | Mac mini M4 / M4 Pro |
|---|---|---|
| Largura de banda | 120 GB/s | 120 GB/s (M4); 273 GB/s (M4 Pro) |
| Memória máxima | 32 GB | Veja a página do Mac mini |
| Tela | Integrado 4,5K de 24 polegadas | Escolher separadamente |
| Velocidade medida 7B Q4_0 | 24,11 t/s | 24,11 t/s (M4); 49,64 t/s (M4 Pro) |
| Escalabilidade | Nenhuma, memória não substituível | O mesmo se aplica à memória, tela substituível |
- Mac mini M4 e M4 Pro: qual LLM de acordo com a memória
- Ficha técnica do Mac mini M4 Pro
- Ficha técnica do iMac, Apple
- Desempenho do llama.cpp em Apple Silicon, repositório llama.cpp
- Documentação Ollama: GPUs suportadas, incluindo Metal
- ModelPiper: limite de memória GPU no Mac
#Perguntas frequentes
O iMac M4 é bom para IA local?+
16, 24 ou 32 GB em um iMac M4 para um LLM?+
Qual a velocidade de um LLM no iMac M4?+
Por que não existe um iMac M4 Pro?+
O iMac M4 com 8 núcleos de GPU é suficiente para um LLM?+
O Ollama utiliza a GPU do iMac M4?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.