Iniciante 11 minMacBook Air

Qual LLM usar em um MacBook Air M2 (8 / 16 / 24 GB) ?

Resposta direta

O MacBook Air M2 executa modelos com 3 a 4 bilhões de parâmetros em 8 GB, de 8 a 9 bilhões em 16 GB e até um modelo de 24B em Q4 em 24 GB. Sua largura de banda de 100 GB/s, 50% maior que a do M1 segundo a Apple, limita a velocidade de um modelo de 8B em Q4 a cerca de 20 tokens por segundo; a memória determina o que pode ser carregado.

O M2 é o primeiro chip do MacBook Air a oferecer 24 GB e 100 GB/s. Esta página explica qual classe de modelo escolher conforme a memória disponível — 8, 16 ou 24 GB —, calcula a velocidade máxima fisicamente possível e indica quando passar para um M4.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-29·Testado no macOS 14+
Hardware recomendado

Opção de compra para este guia: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).

Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.

Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#MacBook Air M2: largura de banda de 100 GB/s e até 24 GB

O MacBook Air M2 traz duas mudanças em relação ao M1 que importam para um LLM: a largura de banda sobe para 100 GB/s e a memória pode chegar a 24 GB. A Apple anuncia 100 GB/s para o M2, ou seja, 50% a mais que o M1; esse é o número oficial, e não um ganho de 47%, como às vezes se lê. A velocidade máxima de geração aumenta, portanto, entre cerca de um terço e metade, dependendo do modelo, e a categoria de modelos que podem ser executados sobe um patamar.

Chip
Apple M2: CPU com 8 núcleos (4 de desempenho, 4 de eficiência), GPU com 8 núcleos, ou 10 núcleos na configuração superior, Neural Engine com 16 núcleos, conforme a ficha técnica da Apple.
Memória
Segundo a ficha Apple, os MacBook Air M2 estão disponíveis com 8 GB (configuráveis para 16 ou 24 GB) e com 16 GB (configuráveis para 24 GB). A memória é soldada: a escolha é feita no momento da compra.
Largura de banda
100 GB/s, segundo Apple, ou seja, 50% a mais que o M1.
Refrigeração
Sem ventoinha: a Apple descreve o MacBook Air M2 como um design silencioso, sem ventoinha. Esse silêncio tem um custo sob carga contínua; veja a seção sobre comportamento térmico.
Bateria
52,6 Wh; a Apple anuncia até 15 horas de navegação web sem fio. Um LLM que exige processamento da GPU consome muito mais do que uma página web.

#8, 16 ou 24 GB: o que cada nível permite

O kit Mac

Em um MacBook Air M2, cada gigabyte conta. O kit Mac ajuda você a escolher o modelo que realmente cabe (cap. 4), calcular seu orçamento de memória (cap. 5) e medir o efeito sobre o calor e a bateria (cap. 6).

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Um modelo não pode ocupar toda a memória: o macOS, o navegador e seus aplicativos ficam com uma parte. Conte com aproximadamente 4 a 5 GB disponíveis em uma máquina de 8 GB, 10 a 11 GB em uma de 16 GB e 16 a 18 GB em uma de 24 GB para o modelo e seu contexto. São estimativas prudentes, que devem ser confrontadas com a pressão de memória no Monitor de Atividade. O tamanho de um modelo segue as referências do site: 3B, cerca de 2 GB; 7-8B, cerca de 5 GB; 14B, cerca de 9 GB; 32B, cerca de 19 a 20 GB em Q4.

Air M2: classe de modelo realista de acordo com a memória (Q4_K_M)
MemóriaMargem para o modelo e o contextoClasse de modelo para uso confortávelNo limite
8 GB≈ 4 a 5 GB3-4B8B com contexto muito curto
16 GB≈ 10 a 11 GB8-9B, contexto médio12B com contexto curto
24 GB≈ 16 a 18 GB12–14B confortável, 8–9B em Q8 ou com contexto longo24B em Q4 (≈ 14 GB) com contexto reduzido

A configuração de 24 GB é a que muda a natureza da máquina: ela permite usar modelos de 24 bilhões de parâmetros em Q4 (cerca de 14 GB de pesos), algo que nenhum Air M1 permite. No entanto, essa configuração é rara: como a memória não pode ser expandida, a maioria dos Air M2 em circulação tem 8 ou 16 GB. Verifique no menu Apple, em “Sobre Este Mac”, quanta memória a máquina realmente tem antes de escolher um modelo.

→
16 GB: o patamar que cobre o essencial
Para resumos, redação, ajuda com programação e RAG leve, um modelo com 8 a 9 bilhões de parâmetros em Q4 é suficiente para a maioria dos usos comuns. A versão de 24 GB se justifica principalmente se você quiser um 24B, um contexto muito longo ou um embedder e um reranker executados em paralelo com o modelo de geração.

#A velocidade máxima que o M2 pode atingir

A geração lê os pesos ativos a cada token: a velocidade máxima é a largura de banda dividida pelo peso em gigabytes. A tabela a seguir aplica a fórmula ao M2 (100 GB/s) e ao M1 (cerca de 68 GB/s). São limites máximos calculados, nunca medições: a velocidade real é menor e depende do mecanismo, da quantização e do tamanho do contexto. Eles permitem verificar se um número anunciado em outro lugar é fisicamente possível.

Limite teórico de geração (considerando apenas os pesos em Q4): cálculo, não medição
ModeloTamanho do modeloAir M1 (≈ 68 GB/s)Air M2 (100 GB/s)
3B≈ 2 GB≈ 34 tok/s≈ 50 tok/s
4B≈ 2,5 a 3 GB≈ 23 a 27 tok/s≈ 33 a 40 tok/s
8B≈ 5 GB≈ 13 tok/s≈ 20 tok/s
12B≈ 7,5 GB≈ 9 tok/s≈ 13 tok/s
24B≈ 14 GBnão aplicável (memória)≈ 7 tok/s

Duas conclusões se impõem. Primeiro, um modelo de 8B em Q4 no M2 fica teoricamente abaixo de 20 tokens por segundo: uma taxa de geração exibida de 25 ou 28 tokens por segundo para esse modelo nesse chip não pode vir da geração clássica. Segundo, um modelo de 24B tem um limite de cerca de 7 tokens por segundo: é utilizável para uma resposta sem pressa, não para uma conversa rápida. Para medições reais, consulte /benchmarks e os benchmarks de terceiros, verificando o chip, a quantização e o mecanismo de execução.

#Instalar um modelo e verificar a GPU

  1. 01
    Instalar Ollama
    Baixe-o em ollama.com ou com Homebrew. O guia de instalação para macOS deste site detalha as opções de inicialização.
  2. 02
    Escolher o modelo de acordo com a memória
    4B com 8 GB, 8-9B com 16 GB, 12-14B ou um 24B em Q4 com 24 GB. Inicie o modelo com ollama run seguido do nome do modelo.
  3. 03
    Verificar a GPU
    Em outro terminal, ollama ps exibe a distribuição CPU/GPU na coluna PROCESSOR. O esperado é que tudo esteja na GPU.
  4. 04
    Ajustar o contexto
    O Ollama define o contexto padrão em 4.000 tokens quando há menos de 24 GiB de memória. Aumente-o progressivamente, em vez de aumentá-lo de uma só vez: o cache KV ocupa memória a cada token.
Terminal
brew install --cask ollama
ollama run qwen3.5:9b
ollama ps

Os modelos são instalados em ~/.ollama/models. Em um Air M2 com SSD de 256 GB, alguns modelos de 5 a 15 GB são suficientes para preencher o espaço livre: remova os que você não usa mais com o comando ollama rm.

Uma referência útil para escolher: comece com o menor modelo que responda corretamente à sua tarefa e passe para o tamanho seguinte somente se as respostas continuarem insuficientes. Em uma máquina com largura de banda limitada, cada bilhão de parâmetros a mais tem um custo em velocidade. Teste dois candidatos com cinco das suas próprias consultas reais antes de decidir: isso leva dez minutos e evita baixar um modelo pesado demais.

#A versão de 24 GB e o RAG: o que essa faixa de memória realmente permite

Um assistente que trabalha com seus documentos exige três componentes: um modelo de embedding que indexa, um modelo de geração que responde e, opcionalmente, um reranker que ordena os trechos. Com 8 GB, há pouco espaço para o conjunto. Com 16 GB, um embedder leve e um modelo de 8–9B coexistem com um contexto curto. Com 24 GB, você pode adicionar um reranker e manter um contexto de vários milhares de tokens sem escrever no SSD. É nesse uso que a faixa superior de memória faz toda a diferença.

Antes da indexação
Verifique se o modelo de embedding cabe na memória junto com o modelo de geração: os dois permanecem carregados durante a requisição.
Durante a solicitação
Insira alguns trechos bem escolhidos em vez de um documento inteiro: o contexto pesa na memória e no tempo de cálculo.
Depois
Se a pressão de memória passar para o amarelo, reduza o número de passagens ou mude para um modelo menor.

#Quantização e cache KV no M2

Em uma máquina limitada pela largura de banda, Q4_K_M continua sendo a configuração padrão: o modelo é menor, portanto mais rápido de ler. Q5_K_M se justifica quando a memória permite e a qualidade é prioridade. Q8_0 quase dobra o tamanho do modelo e reduz aproximadamente pela metade o limite de velocidade. Para o cache KV, Ollama utiliza automaticamente a atenção flash quando o motor e o hardware permitem; a variável OLLAMA_KV_CACHE_TYPE quantiza o cache, com f16 como padrão. Ela torna contextos longos mais acessíveis em 16 GB, ao custo de uma pequena perda de precisão.

#Autonomia, silêncio e aquecimento

O Air M2 não tem ventoinha: ele permanece silencioso, o que é adequado para um escritório tranquilo ou para um assistente deixado rodando durante a noite. O chassi dissipa o calor passivamente, então uma carga de várias dezenas de minutos reduz a frequência do chip. Esta página não informa o tempo nem a temperatura a partir dos quais isso ocorre: nenhuma fonte primária os estabelece, e eles variam conforme o ambiente. Na bateria, a autonomia cai muito mais rápido do que durante a navegação, pois a GPU trabalha continuamente; para uma sessão longa, conecte o computador à tomada.

Processamentos longos
Conecte o computador à tomada, deixe-o em uma posição elevada e evite aplicativos que sobrecarreguem o processador ao mesmo tempo.
Modo de economia de energia
O macOS oferece esse modo nas configurações de bateria. Ele limita o desempenho: reserve-o para deslocamentos em que a autonomia é mais importante do que a velocidade.
Carga contínua
Para um servidor local que responde o dia inteiro, um Mac mini, que tem ventoinha, é mais adequado que um Air.

#Ficar no M2 ou passar para um M3, um M4?

O M3 mantém a mesma largura de banda de 100 GB/s e o mesmo limite de 24 GB no Air, segundo as fichas técnicas da Apple: para um LLM, passar de M2 para M3 praticamente não traz ganhos mensuráveis na geração. O M4 aumenta a largura de banda para 120 GB/s e a memória para 32 GB, o que altera tanto a velocidade máxima quanto a classe de modelos.

Air M2, M3 e M4: o essencial para um LLM local, de acordo com as fichas técnicas da Apple
CritérioAir M2Air M3Air M4
Largura de banda100 GB/s100 GB/s120 GB/s
Memória máxima24 GB24 GB32 GB
DecisãoManter se 16 GB ou 24 GBPoucos motivos para trocar de máquina se você já tem um M2Troque se quiser mais de 24 GB
Fique com seu M2 de 16 ou 24 GB
Roda modelos de 8–9B e 12–14B sem esforço; o M4 melhora a velocidade máxima em apenas cerca de 20%.
Troque se você tiver 8 GB
O ganho diz respeito à classe do modelo, não à velocidade: um Air com no mínimo 16 GB permite passar de 4B para 8-9B.
Mude se quiser mais de 24 GB
Somente o M4 oferece 32 GB no Air; acima disso, veja o MacBook Pro M4 Pro ou Max.

#Perguntas frequentes

FAQ
Um MacBook Air M2 com 8 GB consegue executar um modelo 8B?+
Tecnicamente, sim, em Q4 (cerca de 5 GB de pesos), mas a margem de 4 a 5 GB que o macOS deixa é ultrapassada assim que o contexto aumenta: o sistema então grava no SSD e tudo fica mais lento. Com 8 GB, use um modelo de 3 a 4 bilhões de parâmetros e mantenha o contexto curto.
Qual é a verdadeira diferença entre o MacBook Air M2 e o M3 para um LLM?+
Muito pequena para a geração: de acordo com as fichas da Apple, o Air M3 oferece a mesma largura de banda de 100 GB/s e o mesmo máximo de 24 GB de memória. O M3 traz principalmente outras evoluções, sem efeito direto na velocidade de leitura dos pesos. Se você tem um M2, prefira esperar pelo M4.
O MacBook Air M2 24 GB vale a pena para IA local?+
Sim, se você quiser um modelo de 24 bilhões de parâmetros em Q4 (aproximadamente 14 GB) ou um RAG com embedder e reranker: esses usos não cabem em 16 GB. Caso contrário, 16 GB já são suficientes para modelos de 8 a 9 bilhões de parâmetros. Verifique a memória real da máquina antes de comprar.
A que velocidade um LLM 8B funciona em um MacBook Air M2?+
O limite teórico é a largura de banda dividida pelo peso: 100 GB/s divididos por cerca de 5 GB dão até 20 tokens por segundo para um modelo de 8B em Q4. A velocidade real é inferior, dependendo do motor e do contexto. Consulte /benchmarks ou medições de terceiros que especifiquem o chip e a quantização.
O ventilador do Air M2 liga com um modelo grande?+
Não: não há ventilador. A Apple descreve um design silencioso, sem ventilador. A contrapartida é térmica: sob carga prolongada, o chip reduz sua frequência e a geração fica mais lenta, sem barulho. Para processamentos de várias horas, prefira um Mac mini ou um MacBook Pro.
Ollama ou LM Studio em um Air M2?+
Ollama para começar rapidamente, criar scripts e se integrar a outras ferramentas; LM Studio para usar uma interface gráfica e explorar modelos do Hugging Face. Os dois podem coexistir, mas não devem carregar dois modelos ao mesmo tempo em máquinas com 8 ou 16 GB: a memória é o principal fator limitante.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.