Qual LLM usar em um MacBook Air M2 (8 / 16 / 24 GB) ?
O MacBook Air M2 executa modelos com 3 a 4 bilhões de parâmetros em 8 GB, de 8 a 9 bilhões em 16 GB e até um modelo de 24B em Q4 em 24 GB. Sua largura de banda de 100 GB/s, 50% maior que a do M1 segundo a Apple, limita a velocidade de um modelo de 8B em Q4 a cerca de 20 tokens por segundo; a memória determina o que pode ser carregado.
O M2 é o primeiro chip do MacBook Air a oferecer 24 GB e 100 GB/s. Esta página explica qual classe de modelo escolher conforme a memória disponível — 8, 16 ou 24 GB —, calcula a velocidade máxima fisicamente possível e indica quando passar para um M4.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Opção de compra para este guia: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.
Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#MacBook Air M2: largura de banda de 100 GB/s e até 24 GB
O MacBook Air M2 traz duas mudanças em relação ao M1 que importam para um LLM: a largura de banda sobe para 100 GB/s e a memória pode chegar a 24 GB. A Apple anuncia 100 GB/s para o M2, ou seja, 50% a mais que o M1; esse é o número oficial, e não um ganho de 47%, como às vezes se lê. A velocidade máxima de geração aumenta, portanto, entre cerca de um terço e metade, dependendo do modelo, e a categoria de modelos que podem ser executados sobe um patamar.
- Chip
- Apple M2: CPU com 8 núcleos (4 de desempenho, 4 de eficiência), GPU com 8 núcleos, ou 10 núcleos na configuração superior, Neural Engine com 16 núcleos, conforme a ficha técnica da Apple.
- Memória
- Segundo a ficha Apple, os MacBook Air M2 estão disponíveis com 8 GB (configuráveis para 16 ou 24 GB) e com 16 GB (configuráveis para 24 GB). A memória é soldada: a escolha é feita no momento da compra.
- Largura de banda
- 100 GB/s, segundo Apple, ou seja, 50% a mais que o M1.
- Refrigeração
- Sem ventoinha: a Apple descreve o MacBook Air M2 como um design silencioso, sem ventoinha. Esse silêncio tem um custo sob carga contínua; veja a seção sobre comportamento térmico.
- Bateria
- 52,6 Wh; a Apple anuncia até 15 horas de navegação web sem fio. Um LLM que exige processamento da GPU consome muito mais do que uma página web.
#8, 16 ou 24 GB: o que cada nível permite
Em um MacBook Air M2, cada gigabyte conta. O kit Mac ajuda você a escolher o modelo que realmente cabe (cap. 4), calcular seu orçamento de memória (cap. 5) e medir o efeito sobre o calor e a bateria (cap. 6).
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
Um modelo não pode ocupar toda a memória: o macOS, o navegador e seus aplicativos ficam com uma parte. Conte com aproximadamente 4 a 5 GB disponíveis em uma máquina de 8 GB, 10 a 11 GB em uma de 16 GB e 16 a 18 GB em uma de 24 GB para o modelo e seu contexto. São estimativas prudentes, que devem ser confrontadas com a pressão de memória no Monitor de Atividade. O tamanho de um modelo segue as referências do site: 3B, cerca de 2 GB; 7-8B, cerca de 5 GB; 14B, cerca de 9 GB; 32B, cerca de 19 a 20 GB em Q4.
| Memória | Margem para o modelo e o contexto | Classe de modelo para uso confortável | No limite |
|---|---|---|---|
| 8 GB | ≈ 4 a 5 GB | 3-4B | 8B com contexto muito curto |
| 16 GB | ≈ 10 a 11 GB | 8-9B, contexto médio | 12B com contexto curto |
| 24 GB | ≈ 16 a 18 GB | 12–14B confortável, 8–9B em Q8 ou com contexto longo | 24B em Q4 (≈ 14 GB) com contexto reduzido |
A configuração de 24 GB é a que muda a natureza da máquina: ela permite usar modelos de 24 bilhões de parâmetros em Q4 (cerca de 14 GB de pesos), algo que nenhum Air M1 permite. No entanto, essa configuração é rara: como a memória não pode ser expandida, a maioria dos Air M2 em circulação tem 8 ou 16 GB. Verifique no menu Apple, em “Sobre Este Mac”, quanta memória a máquina realmente tem antes de escolher um modelo.
#A velocidade máxima que o M2 pode atingir
A geração lê os pesos ativos a cada token: a velocidade máxima é a largura de banda dividida pelo peso em gigabytes. A tabela a seguir aplica a fórmula ao M2 (100 GB/s) e ao M1 (cerca de 68 GB/s). São limites máximos calculados, nunca medições: a velocidade real é menor e depende do mecanismo, da quantização e do tamanho do contexto. Eles permitem verificar se um número anunciado em outro lugar é fisicamente possível.
| Modelo | Tamanho do modelo | Air M1 (≈ 68 GB/s) | Air M2 (100 GB/s) |
|---|---|---|---|
| 3B | ≈ 2 GB | ≈ 34 tok/s | ≈ 50 tok/s |
| 4B | ≈ 2,5 a 3 GB | ≈ 23 a 27 tok/s | ≈ 33 a 40 tok/s |
| 8B | ≈ 5 GB | ≈ 13 tok/s | ≈ 20 tok/s |
| 12B | ≈ 7,5 GB | ≈ 9 tok/s | ≈ 13 tok/s |
| 24B | ≈ 14 GB | não aplicável (memória) | ≈ 7 tok/s |
Duas conclusões se impõem. Primeiro, um modelo de 8B em Q4 no M2 fica teoricamente abaixo de 20 tokens por segundo: uma taxa de geração exibida de 25 ou 28 tokens por segundo para esse modelo nesse chip não pode vir da geração clássica. Segundo, um modelo de 24B tem um limite de cerca de 7 tokens por segundo: é utilizável para uma resposta sem pressa, não para uma conversa rápida. Para medições reais, consulte /benchmarks e os benchmarks de terceiros, verificando o chip, a quantização e o mecanismo de execução.
#Instalar um modelo e verificar a GPU
- 01Instalar OllamaBaixe-o em ollama.com ou com Homebrew. O guia de instalação para macOS deste site detalha as opções de inicialização.
- 02Escolher o modelo de acordo com a memória4B com 8 GB, 8-9B com 16 GB, 12-14B ou um 24B em Q4 com 24 GB. Inicie o modelo com ollama run seguido do nome do modelo.
- 03Verificar a GPUEm outro terminal, ollama ps exibe a distribuição CPU/GPU na coluna PROCESSOR. O esperado é que tudo esteja na GPU.
- 04Ajustar o contextoO Ollama define o contexto padrão em 4.000 tokens quando há menos de 24 GiB de memória. Aumente-o progressivamente, em vez de aumentá-lo de uma só vez: o cache KV ocupa memória a cada token.
Os modelos são instalados em ~/.ollama/models. Em um Air M2 com SSD de 256 GB, alguns modelos de 5 a 15 GB são suficientes para preencher o espaço livre: remova os que você não usa mais com o comando ollama rm.
Uma referência útil para escolher: comece com o menor modelo que responda corretamente à sua tarefa e passe para o tamanho seguinte somente se as respostas continuarem insuficientes. Em uma máquina com largura de banda limitada, cada bilhão de parâmetros a mais tem um custo em velocidade. Teste dois candidatos com cinco das suas próprias consultas reais antes de decidir: isso leva dez minutos e evita baixar um modelo pesado demais.
#A versão de 24 GB e o RAG: o que essa faixa de memória realmente permite
Um assistente que trabalha com seus documentos exige três componentes: um modelo de embedding que indexa, um modelo de geração que responde e, opcionalmente, um reranker que ordena os trechos. Com 8 GB, há pouco espaço para o conjunto. Com 16 GB, um embedder leve e um modelo de 8–9B coexistem com um contexto curto. Com 24 GB, você pode adicionar um reranker e manter um contexto de vários milhares de tokens sem escrever no SSD. É nesse uso que a faixa superior de memória faz toda a diferença.
- Antes da indexação
- Verifique se o modelo de embedding cabe na memória junto com o modelo de geração: os dois permanecem carregados durante a requisição.
- Durante a solicitação
- Insira alguns trechos bem escolhidos em vez de um documento inteiro: o contexto pesa na memória e no tempo de cálculo.
- Depois
- Se a pressão de memória passar para o amarelo, reduza o número de passagens ou mude para um modelo menor.
#Quantização e cache KV no M2
Em uma máquina limitada pela largura de banda, Q4_K_M continua sendo a configuração padrão: o modelo é menor, portanto mais rápido de ler. Q5_K_M se justifica quando a memória permite e a qualidade é prioridade. Q8_0 quase dobra o tamanho do modelo e reduz aproximadamente pela metade o limite de velocidade. Para o cache KV, Ollama utiliza automaticamente a atenção flash quando o motor e o hardware permitem; a variável OLLAMA_KV_CACHE_TYPE quantiza o cache, com f16 como padrão. Ela torna contextos longos mais acessíveis em 16 GB, ao custo de uma pequena perda de precisão.
#Autonomia, silêncio e aquecimento
O Air M2 não tem ventoinha: ele permanece silencioso, o que é adequado para um escritório tranquilo ou para um assistente deixado rodando durante a noite. O chassi dissipa o calor passivamente, então uma carga de várias dezenas de minutos reduz a frequência do chip. Esta página não informa o tempo nem a temperatura a partir dos quais isso ocorre: nenhuma fonte primária os estabelece, e eles variam conforme o ambiente. Na bateria, a autonomia cai muito mais rápido do que durante a navegação, pois a GPU trabalha continuamente; para uma sessão longa, conecte o computador à tomada.
- Processamentos longos
- Conecte o computador à tomada, deixe-o em uma posição elevada e evite aplicativos que sobrecarreguem o processador ao mesmo tempo.
- Modo de economia de energia
- O macOS oferece esse modo nas configurações de bateria. Ele limita o desempenho: reserve-o para deslocamentos em que a autonomia é mais importante do que a velocidade.
- Carga contínua
- Para um servidor local que responde o dia inteiro, um Mac mini, que tem ventoinha, é mais adequado que um Air.
#Ficar no M2 ou passar para um M3, um M4?
O M3 mantém a mesma largura de banda de 100 GB/s e o mesmo limite de 24 GB no Air, segundo as fichas técnicas da Apple: para um LLM, passar de M2 para M3 praticamente não traz ganhos mensuráveis na geração. O M4 aumenta a largura de banda para 120 GB/s e a memória para 32 GB, o que altera tanto a velocidade máxima quanto a classe de modelos.
| Critério | Air M2 | Air M3 | Air M4 |
|---|---|---|---|
| Largura de banda | 100 GB/s | 100 GB/s | 120 GB/s |
| Memória máxima | 24 GB | 24 GB | 32 GB |
| Decisão | Manter se 16 GB ou 24 GB | Poucos motivos para trocar de máquina se você já tem um M2 | Troque se quiser mais de 24 GB |
- Fique com seu M2 de 16 ou 24 GB
- Roda modelos de 8–9B e 12–14B sem esforço; o M4 melhora a velocidade máxima em apenas cerca de 20%.
- Troque se você tiver 8 GB
- O ganho diz respeito à classe do modelo, não à velocidade: um Air com no mínimo 16 GB permite passar de 4B para 8-9B.
- Mude se quiser mais de 24 GB
- Somente o M4 oferece 32 GB no Air; acima disso, veja o MacBook Pro M4 Pro ou Max.
- MacBook Air M1: os limites com 8 e 16 GB
- MacBook Air M3: os mesmos 100 GB/s
- MacBook Air M4: 32 GB e 120 GB/s
- Instalar Ollama no macOS
- MacBook Pro M4 Pro e Max, até 128 GB
- Calculadora de VRAM do site
- Fonte: ficha técnica da Apple para o MacBook Air M2
- Fonte: Apple, anúncio do chip M2
- Fonte: ficha técnica Apple do MacBook Air M4
- Fonte: documentação Ollama, contexto
#Perguntas frequentes
Um MacBook Air M2 com 8 GB consegue executar um modelo 8B?+
Qual é a verdadeira diferença entre o MacBook Air M2 e o M3 para um LLM?+
O MacBook Air M2 24 GB vale a pena para IA local?+
A que velocidade um LLM 8B funciona em um MacBook Air M2?+
O ventilador do Air M2 liga com um modelo grande?+
Ollama ou LM Studio em um Air M2?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.