Iniciante 11 minMacBook Air

Qual LLM para MacBook Air M4 (16 / 24 / 32 GB) ?

Resposta direta

O MacBook Air M4 executa confortavelmente modelos de 8 a 12 bilhões de parâmetros com 16 GB, um modelo de 24B em Q4 com 24 GB e um modelo de especialistas de 30B com 32 GB. Sua largura de banda de 120 GB/s limita um modelo de 8B em Q4 a cerca de 24 tokens por segundo; a memória, que não pode ser expandida, determina o tamanho do modelo.

O M4 é o primeiro Air a oferecer 16 GB na configuração básica e até 32 GB. Esta página indica qual configuração de memória escolher, calcula a velocidade máxima que o chip pode atingir, compara com o Air M5, o MacBook Pro e o Mac mini e aponta os limites do Air.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-29·Testado no macOS 14+
Hardware recomendado

Opção de compra para este guia: MacBook Pro M5 Pro — 24 GB / 1 TB.

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#MacBook Air M4: 120 GB/s e até 32 GB de memória

O MacBook Air M4 é o primeiro Air a vir com 16 GB de memória unificada na configuração básica e a suportar até 32 GB, com uma largura de banda de 120 GB/s. Para um LLM, esses dois números importam mais do que o número de núcleos: a memória determina o tamanho do modelo que pode ser carregado, e a largura de banda define sua velocidade máxima. A 120 GB/s, um modelo de 8 bilhões de parâmetros em Q4 não ultrapassa 24 tokens por segundo em teoria; a velocidade real é menor.

Chip
Apple M4: CPU com 10 núcleos (4 de desempenho, 6 de eficiência), GPU com 8 ou 10 núcleos, Neural Engine com 16 núcleos, de acordo com a ficha técnica da Apple.
Memória
16 GB por padrão, com opções de 24 ou 32 GB. A memória é soldada: a configuração é escolhida na compra.
Largura de banda
120 GB/s, de acordo com a ficha Apple, ou seja, 20 % a mais do que os 100 GB/s do Air M3.
Neural Engine
A Apple anuncia até 38 trilhões de operações por segundo para o M4. Os mecanismos de execução mais comuns (Ollama, llama.cpp) são executados principalmente na GPU via Metal; portanto, esse número não se traduz em tokens por segundo.
Refrigeração
Sem ventilador: o calor é dissipado pelo chassi, o que limita cargas de trabalho muito prolongadas.

Não há VRAM separada em um Mac: a GPU utiliza a memória unificada. Quando se procura por "VRAM do MacBook Air M4", a resposta prática é a memória total menos a parte reservada ao sistema, respeitando o limite que o macOS permite à GPU. Esse limite pode ser ajustado; o guia de otimização do macOS do site explica como e quais são os riscos.

#16, 24 ou 32 GB: escolher sua memória

O kit Mac

IA local no seu Mac, a fundo: memória unificada, MLX vs GGUF, o modelo certo para seu chip, Ollama e LM Studio ajustados para Apple Silicon.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

O modelo, o contexto e o sistema compartilham a memória. As margens abaixo são estimativas prudentes que devem ser comparadas com a pressão de memória do Monitor de Atividade: cerca de 11 a 12 GB para um modelo em uma máquina com 16 GB, 17 a 19 GB em uma máquina com 24 GB e 24 a 26 GB em uma máquina com 32 GB. O tamanho dos modelos segue os valores de referência do site: cerca de 5 GB para 8B, cerca de 9 GB para 14B, cerca de 14 GB para 24B e cerca de 19 a 20 GB para 32B em Q4.

MacBook Air M4: classe de modelo conforme a memória (Q4_K_M)
MemóriaMargem estimadaClasse de modelo para uso confortávelNo limite
16 GB≈ 11 a 12 GB8-9B com contexto médio, 12B em Q414B em Q4 com contexto curto
24 GB≈ 17 a 19 GB12-14B confortável, 24B em Q4 (≈ 14 GB)27B em Q4 (≈ 16 GB) com contexto reduzido
32 GB≈ 24 a 26 GB24B em Q5-Q6, 27B em Q4, modelos MoE de 30B32B denso em Q4 (≈ 19-20 GB) com contexto longo
i
O patamar útil depende da geração de modelos
Modelos com especialistas (MoE) mudam o cálculo: um 30B com 3B ativos ocupa aproximadamente 19 GB de memória, mas só relê uma pequena fração dos pesos a cada token. Com 32 GB, ele roda muito mais rápido que um modelo denso de mesmo tamanho em memória. Com 16 GB, ele não pode ser carregado: a memória continua sendo o primeiro filtro.

A questão então é saber qual tamanho você deseja atingir. Se você se limitar a modelos com 8 a 12 bilhões de parâmetros, 16 GB são suficientes. Para modelos de 24B ou para um RAG com embedder e reranker em paralelo, 24 GB representam o primeiro nível confortável. Com 32 GB, você ganha principalmente contexto longo e modelos MoE de 30B.

#A velocidade máxima com 120 GB/s de largura de banda

O princípio: cada token gerado exige a leitura dos pesos ativos. O limite é a largura de banda dividida pelo tamanho dos pesos em gigabytes. A tabela aplica essa fórmula ao M4 (120 GB/s). São limites calculados, não medições: a velocidade real depende do motor, da quantização, do contexto e da temperatura do chip.

Limite teórico de geração no Air M4 (120 GB/s, pesos ativos em Q4): cálculo, não medição
ModeloPesos ativosCálculoTeto
3B≈ 2 GB120 ÷ 2≈ 60 tok/s
8B≈ 5 GB120 ÷ 5≈ 24 tok/s
9B≈ 6 GB120 ÷ 6≈ 20 tok/s
14B≈ 9 GB120 ÷ 9≈ 13 tok/s
24B≈ 14 GB120 ÷ 14≈ 8 a 9 tok/s
32B denso≈ 19 a 20 GB120 ÷ 19,5≈ 6 tok/s

Duas consequências práticas. Um 8B em Q4 não ultrapassará cerca de 24 tokens por segundo nesse chip: uma velocidade anunciada de 34 tokens por segundo para esse modelo é impossível sem outra técnica. E um 24B denso fica em torno de 8 tokens por segundo, no melhor dos casos, ou seja, a velocidade de uma leitura atenta: confortável para um texto lido com calma, lento para um agente que encadeia chamadas. Para medições reais, consulte /benchmarks e fontes de terceiros que especifiquem o chip e a quantização.

#M4 ou M5: a próxima geração muda a situação?

A Apple agora oferece um MacBook Air M5. Sua ficha técnica indica 153 GB/s de largura de banda, contra 120 GB/s no M4, ou seja, cerca de 28% a mais, com as mesmas opções de 16, 24 ou 32 GB de memória. Para um LLM limitado pela largura de banda, a diferença teórica na velocidade máxima é da mesma ordem: um modelo 8B em Q4 passaria de cerca de 24 para cerca de 30 tokens por segundo no limite.

Air M4 e Air M5: os números úteis para um LLM, de acordo com a Apple
CritérioAir M4Air M5
Largura de banda120 GB/s153 GB/s
Memória16, 24 ou 32 GB16, 24 ou 32 GB
Limite teórico: 8B Q4≈ 24 tok/s≈ 30 tok/s

A memória não muda: um Air M5 de 16 GB não abre mais modelos do que um Air M4 de 16 GB. Se você encontrar um M4 configurado com 24 ou 32 GB, ele é melhor que um M5 de 16 GB quando se trata do tamanho dos modelos; com a mesma quantidade de memória, o M5 é mais rápido. Compare os preços atuais nas lojas, eles mudam demais para serem listados aqui.

#Instalar e escolher o motor

  1. 01
    Instalar Ollama
    Baixe no ollama.com ou com Homebrew. O guia de instalação para macOS detalha o início automático.
  2. 02
    Iniciar um modelo com base na memória
    9B com 16 GB, 24B em Q4 com 24 GB, um MoE de 30B com 32 GB. Na primeira execução, o modelo é baixado.
  3. 03
    Verificar a GPU
    ollama ps affiche la répartition CPU/GPU dans la colonne PROCESSOR : tout sur le GPU est l'état attendu.
  4. 04
    Ajustar o contexto
    Com menos de 24 GiB de memória, o Ollama define o contexto padrão em 4.000 tokens. Aumente conforme a necessidade real; o cache KV cresce junto com ele.
Terminal
brew install --cask ollama
ollama run qwen3.5:9b
ollama ps

MLX, o framework da Apple, aproveita a memória compartilhada do Mac sem copiar os dados entre CPU e GPU; o LM Studio o oferece na forma de modelos MLX. As duas opções funcionam: Ollama para a simplicidade e a API local, MLX e LM Studio para explorar os formatos da Apple. O guia MLX versus llama.cpp compara as duas abordagens, sem que seja necessário repetir suas conclusões aqui.

#Contexto longo e limite de memória do GPU

O modelo é apenas uma parte do consumo de memória: cada token de contexto adiciona uma entrada ao cache KV, e a memória realmente disponível para a GPU é limitada pelo macOS. O Ollama utiliza automaticamente a atenção flash quando o motor e o hardware permitem e possibilita quantizar o cache KV com a variável OLLAMA_KV_CACHE_TYPE (f16 por padrão). Em 16 GB, esse ajuste muitas vezes faz a diferença entre um contexto curto e um contexto de vários milhares de tokens.

No caso do MLX, o repositório mlx-lm indica que um modelo que cabe na memória muitas vezes pode ser acelerado aumentando o limite de memória não paginável (wired) do sistema, por meio de um ajuste sysctl. Trata-se de uma modificação no sistema: exige permissões de administrador, não persiste necessariamente após uma reinicialização e pode desestabilizar a máquina se o valor for muito alto. O guia de otimização do macOS detalha o procedimento e um valor razoável conforme a memória disponível; não altere esse limite sem ter lido o guia.

Terminal
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_FLASH_ATTENTION=1
ollama serve

#Air M4, MacBook Pro ou Mac mini: qual escolher para cada uso

O Air M4 ganha em leveza e silêncio, mas não tem ventoinha: uma carga prolongada reduz a frequência do chip. O MacBook Pro M4 Pro ou Max acrescenta ventoinhas, uma largura de banda de 273 a 546 GB/s e até 128 GB de memória, segundo a ficha técnica da Apple; o Mac mini M4 oferece um computador de mesa com refrigeração ativa.

Escolher conforme o uso
Sua necessidadeMáquina adequadaPor quê
Chat, resumo, código leve, mobilidadeAir M4 16 ou 24 GBSilêncio, autonomia, modelos de 8 a 14B
Modelos de 24 a 32B, contexto longoAir M4 32 GB ou Mac miniMemória suficiente; Mac mini, se a máquina permanecer no escritório
Processos longos, vários modelosMacBook Pro M4 Pro ou Max, Mac miniVentilação ativa, banda passante superior
Modelos de 70BMacBook Pro Max ou Mac StudioUm modelo de 70B pesa aproximadamente 40 GB em Q4: fora do alcance de um Air

#Limitações que você deve conhecer

Carga prolongada
Sem ventilador, uma geração contínua de algumas dezenas de minutos acaba reduzindo a frequência. Para um chat, o efeito não é percebido; para indexação ou processos em lote, é melhor usar uma máquina com ventilador.
Sem 70B
Um 70B pesa cerca de 40 GB em Q4: mais do que os 32 GB máximos do Air.
O Neural Engine não acelera Ollama
Os motores mais usados utilizam a GPU via Metal. A NPU só entra em ação em determinados usos com Core ML.
Armazenamento
Os modelos ocupam vários gigabytes cada um no diretório de modelos do Ollama: um SSD de 256 GB se preenche rapidamente com vários modelos de 5 a 15 GB.

#Perguntas frequentes

FAQ
O MacBook Air M4 de 16 GB é suficiente para um LLM local?+
Sim, para modelos de 8 a 12 bilhões de parâmetros em Q4, que pesam entre 5 e 8 GB e deixam margem para o sistema e para o contexto. Um modelo de 14 bilhões funciona com um contexto curto. Para um modelo de 24B ou um RAG pesado, é preciso optar por 24 ou 32 GB, pois a memória não pode ser expandida.
Quantos GB de VRAM tem um MacBook Air M4?+
Não há VRAM separada: a GPU compartilha a memória unificada com o processador, de 16, 24 ou 32 GB conforme a configuração. O macOS limita a parcela que a GPU pode reservar, então o modelo carregado não pode ocupar toda a memória. O guia de otimização para macOS explica como aumentar esse limite.
Qual velocidade esperar de um modelo 8B em um MacBook Air M4?+
O limite teórico é de 120 GB/s dividido por cerca de 5 GB, ou seja, 24 tokens por segundo no máximo para um 8B em Q4. A velocidade real é inferior e depende do motor e do contexto. Uma taxa anunciada claramente acima desse limite deve gerar suspeita.
É possível rodar um modelo com 30 bilhões de parâmetros no Air M4?+
Apenas em 32 GB, preferencialmente um modelo com especialistas e poucos parâmetros ativos. Um modelo de 30B pesa cerca de 19 GB em Q4: cabe na margem de 24 a 26 GB, mas um modelo denso de 30B continua lento, em torno de 6 tokens por segundo no máximo. Em 16 GB, ele não carrega.
É necessário esperar o Air M5 para a IA local?+
O M5 oferece 153 GB/s contra 120 GB/s, ou seja, cerca de 28% a mais de largura de banda, mas as mesmas opções de 16, 24 ou 32 GB. Se você encontrar um M4 com mais memória do que um M5 no mesmo orçamento, escolha a memória: ela decide o tamanho do modelo.
O MacBook Air M4 aquece com um LLM?+
Ele não tem ventoinha, então aquece e reduz sua frequência sob carga prolongada. Em interações curtas, o efeito é pequeno. Em processamentos longos, conecte-o à tomada, eleve a máquina e escolha um modelo menor. Para uso sob carga contínua, prefira um Mac mini ou um MacBook Pro.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.