Qual LLM para MacBook Air M4 (16 / 24 / 32 GB) ?
O MacBook Air M4 executa confortavelmente modelos de 8 a 12 bilhões de parâmetros com 16 GB, um modelo de 24B em Q4 com 24 GB e um modelo de especialistas de 30B com 32 GB. Sua largura de banda de 120 GB/s limita um modelo de 8B em Q4 a cerca de 24 tokens por segundo; a memória, que não pode ser expandida, determina o tamanho do modelo.
O M4 é o primeiro Air a oferecer 16 GB na configuração básica e até 32 GB. Esta página indica qual configuração de memória escolher, calcula a velocidade máxima que o chip pode atingir, compara com o Air M5, o MacBook Pro e o Mac mini e aponta os limites do Air.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Opção de compra para este guia: MacBook Pro M5 Pro — 24 GB / 1 TB.
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#MacBook Air M4: 120 GB/s e até 32 GB de memória
O MacBook Air M4 é o primeiro Air a vir com 16 GB de memória unificada na configuração básica e a suportar até 32 GB, com uma largura de banda de 120 GB/s. Para um LLM, esses dois números importam mais do que o número de núcleos: a memória determina o tamanho do modelo que pode ser carregado, e a largura de banda define sua velocidade máxima. A 120 GB/s, um modelo de 8 bilhões de parâmetros em Q4 não ultrapassa 24 tokens por segundo em teoria; a velocidade real é menor.
- Chip
- Apple M4: CPU com 10 núcleos (4 de desempenho, 6 de eficiência), GPU com 8 ou 10 núcleos, Neural Engine com 16 núcleos, de acordo com a ficha técnica da Apple.
- Memória
- 16 GB por padrão, com opções de 24 ou 32 GB. A memória é soldada: a configuração é escolhida na compra.
- Largura de banda
- 120 GB/s, de acordo com a ficha Apple, ou seja, 20 % a mais do que os 100 GB/s do Air M3.
- Neural Engine
- A Apple anuncia até 38 trilhões de operações por segundo para o M4. Os mecanismos de execução mais comuns (Ollama, llama.cpp) são executados principalmente na GPU via Metal; portanto, esse número não se traduz em tokens por segundo.
- Refrigeração
- Sem ventilador: o calor é dissipado pelo chassi, o que limita cargas de trabalho muito prolongadas.
Não há VRAM separada em um Mac: a GPU utiliza a memória unificada. Quando se procura por "VRAM do MacBook Air M4", a resposta prática é a memória total menos a parte reservada ao sistema, respeitando o limite que o macOS permite à GPU. Esse limite pode ser ajustado; o guia de otimização do macOS do site explica como e quais são os riscos.
#16, 24 ou 32 GB: escolher sua memória
IA local no seu Mac, a fundo: memória unificada, MLX vs GGUF, o modelo certo para seu chip, Ollama e LM Studio ajustados para Apple Silicon.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
O modelo, o contexto e o sistema compartilham a memória. As margens abaixo são estimativas prudentes que devem ser comparadas com a pressão de memória do Monitor de Atividade: cerca de 11 a 12 GB para um modelo em uma máquina com 16 GB, 17 a 19 GB em uma máquina com 24 GB e 24 a 26 GB em uma máquina com 32 GB. O tamanho dos modelos segue os valores de referência do site: cerca de 5 GB para 8B, cerca de 9 GB para 14B, cerca de 14 GB para 24B e cerca de 19 a 20 GB para 32B em Q4.
| Memória | Margem estimada | Classe de modelo para uso confortável | No limite |
|---|---|---|---|
| 16 GB | ≈ 11 a 12 GB | 8-9B com contexto médio, 12B em Q4 | 14B em Q4 com contexto curto |
| 24 GB | ≈ 17 a 19 GB | 12-14B confortável, 24B em Q4 (≈ 14 GB) | 27B em Q4 (≈ 16 GB) com contexto reduzido |
| 32 GB | ≈ 24 a 26 GB | 24B em Q5-Q6, 27B em Q4, modelos MoE de 30B | 32B denso em Q4 (≈ 19-20 GB) com contexto longo |
A questão então é saber qual tamanho você deseja atingir. Se você se limitar a modelos com 8 a 12 bilhões de parâmetros, 16 GB são suficientes. Para modelos de 24B ou para um RAG com embedder e reranker em paralelo, 24 GB representam o primeiro nível confortável. Com 32 GB, você ganha principalmente contexto longo e modelos MoE de 30B.
#A velocidade máxima com 120 GB/s de largura de banda
O princípio: cada token gerado exige a leitura dos pesos ativos. O limite é a largura de banda dividida pelo tamanho dos pesos em gigabytes. A tabela aplica essa fórmula ao M4 (120 GB/s). São limites calculados, não medições: a velocidade real depende do motor, da quantização, do contexto e da temperatura do chip.
| Modelo | Pesos ativos | Cálculo | Teto |
|---|---|---|---|
| 3B | ≈ 2 GB | 120 ÷ 2 | ≈ 60 tok/s |
| 8B | ≈ 5 GB | 120 ÷ 5 | ≈ 24 tok/s |
| 9B | ≈ 6 GB | 120 ÷ 6 | ≈ 20 tok/s |
| 14B | ≈ 9 GB | 120 ÷ 9 | ≈ 13 tok/s |
| 24B | ≈ 14 GB | 120 ÷ 14 | ≈ 8 a 9 tok/s |
| 32B denso | ≈ 19 a 20 GB | 120 ÷ 19,5 | ≈ 6 tok/s |
Duas consequências práticas. Um 8B em Q4 não ultrapassará cerca de 24 tokens por segundo nesse chip: uma velocidade anunciada de 34 tokens por segundo para esse modelo é impossível sem outra técnica. E um 24B denso fica em torno de 8 tokens por segundo, no melhor dos casos, ou seja, a velocidade de uma leitura atenta: confortável para um texto lido com calma, lento para um agente que encadeia chamadas. Para medições reais, consulte /benchmarks e fontes de terceiros que especifiquem o chip e a quantização.
#M4 ou M5: a próxima geração muda a situação?
A Apple agora oferece um MacBook Air M5. Sua ficha técnica indica 153 GB/s de largura de banda, contra 120 GB/s no M4, ou seja, cerca de 28% a mais, com as mesmas opções de 16, 24 ou 32 GB de memória. Para um LLM limitado pela largura de banda, a diferença teórica na velocidade máxima é da mesma ordem: um modelo 8B em Q4 passaria de cerca de 24 para cerca de 30 tokens por segundo no limite.
| Critério | Air M4 | Air M5 |
|---|---|---|
| Largura de banda | 120 GB/s | 153 GB/s |
| Memória | 16, 24 ou 32 GB | 16, 24 ou 32 GB |
| Limite teórico: 8B Q4 | ≈ 24 tok/s | ≈ 30 tok/s |
A memória não muda: um Air M5 de 16 GB não abre mais modelos do que um Air M4 de 16 GB. Se você encontrar um M4 configurado com 24 ou 32 GB, ele é melhor que um M5 de 16 GB quando se trata do tamanho dos modelos; com a mesma quantidade de memória, o M5 é mais rápido. Compare os preços atuais nas lojas, eles mudam demais para serem listados aqui.
#Instalar e escolher o motor
- 01Instalar OllamaBaixe no ollama.com ou com Homebrew. O guia de instalação para macOS detalha o início automático.
- 02Iniciar um modelo com base na memória9B com 16 GB, 24B em Q4 com 24 GB, um MoE de 30B com 32 GB. Na primeira execução, o modelo é baixado.
- 03Verificar a GPUollama ps affiche la répartition CPU/GPU dans la colonne PROCESSOR : tout sur le GPU est l'état attendu.
- 04Ajustar o contextoCom menos de 24 GiB de memória, o Ollama define o contexto padrão em 4.000 tokens. Aumente conforme a necessidade real; o cache KV cresce junto com ele.
MLX, o framework da Apple, aproveita a memória compartilhada do Mac sem copiar os dados entre CPU e GPU; o LM Studio o oferece na forma de modelos MLX. As duas opções funcionam: Ollama para a simplicidade e a API local, MLX e LM Studio para explorar os formatos da Apple. O guia MLX versus llama.cpp compara as duas abordagens, sem que seja necessário repetir suas conclusões aqui.
#Contexto longo e limite de memória do GPU
O modelo é apenas uma parte do consumo de memória: cada token de contexto adiciona uma entrada ao cache KV, e a memória realmente disponível para a GPU é limitada pelo macOS. O Ollama utiliza automaticamente a atenção flash quando o motor e o hardware permitem e possibilita quantizar o cache KV com a variável OLLAMA_KV_CACHE_TYPE (f16 por padrão). Em 16 GB, esse ajuste muitas vezes faz a diferença entre um contexto curto e um contexto de vários milhares de tokens.
No caso do MLX, o repositório mlx-lm indica que um modelo que cabe na memória muitas vezes pode ser acelerado aumentando o limite de memória não paginável (wired) do sistema, por meio de um ajuste sysctl. Trata-se de uma modificação no sistema: exige permissões de administrador, não persiste necessariamente após uma reinicialização e pode desestabilizar a máquina se o valor for muito alto. O guia de otimização do macOS detalha o procedimento e um valor razoável conforme a memória disponível; não altere esse limite sem ter lido o guia.
#Air M4, MacBook Pro ou Mac mini: qual escolher para cada uso
O Air M4 ganha em leveza e silêncio, mas não tem ventoinha: uma carga prolongada reduz a frequência do chip. O MacBook Pro M4 Pro ou Max acrescenta ventoinhas, uma largura de banda de 273 a 546 GB/s e até 128 GB de memória, segundo a ficha técnica da Apple; o Mac mini M4 oferece um computador de mesa com refrigeração ativa.
| Sua necessidade | Máquina adequada | Por quê |
|---|---|---|
| Chat, resumo, código leve, mobilidade | Air M4 16 ou 24 GB | Silêncio, autonomia, modelos de 8 a 14B |
| Modelos de 24 a 32B, contexto longo | Air M4 32 GB ou Mac mini | Memória suficiente; Mac mini, se a máquina permanecer no escritório |
| Processos longos, vários modelos | MacBook Pro M4 Pro ou Max, Mac mini | Ventilação ativa, banda passante superior |
| Modelos de 70B | MacBook Pro Max ou Mac Studio | Um modelo de 70B pesa aproximadamente 40 GB em Q4: fora do alcance de um Air |
- MacBook Pro M4 Pro e Max: 273 a 546 GB/s
- Mac mini M4 e M4 Pro para um LLM
- MacBook Air M2: 100 GB/s, no máximo 24 GB
- MLX contra llama.cpp no Mac
- Otimizar um Mac Apple Silicon para os LLM
- Qual LLM para 16 GB de memória
- Fonte: ficha técnica do MacBook Air M4 da Apple
- Fonte: ficha técnica Apple do MacBook Air atual
- Fonte: ficha técnica da Apple do MacBook Pro M4 Pro e Max
- Fonte: documentação Ollama, contexto
#Limitações que você deve conhecer
- Carga prolongada
- Sem ventilador, uma geração contínua de algumas dezenas de minutos acaba reduzindo a frequência. Para um chat, o efeito não é percebido; para indexação ou processos em lote, é melhor usar uma máquina com ventilador.
- Sem 70B
- Um 70B pesa cerca de 40 GB em Q4: mais do que os 32 GB máximos do Air.
- O Neural Engine não acelera Ollama
- Os motores mais usados utilizam a GPU via Metal. A NPU só entra em ação em determinados usos com Core ML.
- Armazenamento
- Os modelos ocupam vários gigabytes cada um no diretório de modelos do Ollama: um SSD de 256 GB se preenche rapidamente com vários modelos de 5 a 15 GB.
#Perguntas frequentes
O MacBook Air M4 de 16 GB é suficiente para um LLM local?+
Quantos GB de VRAM tem um MacBook Air M4?+
Qual velocidade esperar de um modelo 8B em um MacBook Air M4?+
É possível rodar um modelo com 30 bilhões de parâmetros no Air M4?+
É necessário esperar o Air M5 para a IA local?+
O MacBook Air M4 aquece com um LLM?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.