Qual LLM no MacBook Air M3 (8 / 16 / 24 GB) ?
IA local no MacBook Air M3: com 16 GB de memória unificada, um modelo com 8 a 9 bilhões de parâmetros em Q4 roda com folga; com 8 GB, limite-se a modelos de 3–4B; com 24 GB, um modelo de 24B carrega, mas a largura de banda de 100 GB/s o torna lento. O M3 não é mais rápido que o M2 para gerar texto: as medições publicadas mostram taxas de geração quase idênticas. Não o confunda com Apple Intelligence, que é um serviço diferente.
O MacBook Air M3 é o notebook Apple mais usado para testar IA local. É silencioso, sem ventilador, e consegue rodar modelos de 8 a 9 bilhões de parâmetros sem problemas. A seguir, o que cada configuração de memória permite, o que os dados publicados dizem sobre a velocidade, o que não mudou desde o M2 e os ajustes que realmente importam.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Opção de compra para este guia: MacBook Pro M5 Pro — 24 GB / 1 TB.
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#MacBook Air M3 em 2026: a ficha técnica útil para os LLM
De acordo com a ficha técnica da Apple, o chip M3 do MacBook Air combina uma CPU com 8 núcleos (4 de desempenho e 4 de eficiência), uma GPU com 8 ou 10 núcleos, um Neural Engine com 16 núcleos e uma largura de banda de memória de 100 GB/s. A memória unificada é soldada: a Apple lista duas configurações de entrada, 8 GB ou 16 GB, ambas ampliáveis para 24 GB no momento da compra. O modelo está disponível em versões de 13 e 15 polegadas com o mesmo chip.
- Largura de banda
- 100 GB/s, igual à do M2. É ela, mais do que o número de núcleos do GPU, que limita a velocidade de geração.
- Refrigeração
- Sem ventoinha. O chip só consegue dissipar o calor pelo chassi: durante uma geração longa, ele acaba reduzindo sua frequência.
- Neural Engine
- 16 núcleos, mas as ferramentas comuns de IA local (Ollama, llama.cpp, LM Studio) usam a GPU via Metal, não o Neural Engine.
- Novidade do M3
- O Dynamic Caching, que aloca em tempo real a memória local da GPU. Não temos medições do seu efeito nos LLMs e não prometemos nenhum efeito.
#IA local ou Apple Intelligence: duas coisas diferentes
IA local no seu Mac, a fundo: memória unificada, MLX vs GGUF, o modelo certo para seu chip, Ollama e LM Studio ajustados para Apple Silicon.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
Muitas pesquisas sobre o MacBook Air M3 tratam de “IA” no sentido amplo. Apple Intelligence é o conjunto de funções integrado ao macOS (resumos, escrita, Siri); segundo a Apple, ele funciona em Macs equipados com um chip M1 ou mais recente, portanto também no MacBook Air M3. Ele não permite que você escolha o modelo, exponha uma API ou trabalhe com seus próprios documentos usando um modelo aberto.
A IA local, mencionada neste guia, consiste em baixar um modelo aberto (Qwen, Gemma, Granite, Mistral) e executá-lo com Ollama, LM Studio ou MLX. Você escolhe o modelo, o tamanho do contexto e o que fica na máquina. Os dois podem coexistir; a memória é, no entanto, compartilhada, e um modelo com 9 bilhões de parâmetros carregado reduz o que resta para macOS e para os aplicativos.
#Quantidade de memória: 8, 16 ou 24 GB
A memória é o primeiro critério, porque um modelo que excede a capacidade disponível não fica mais lento: ele se torna inutilizável. No Apple Silicon, a GPU não consegue usar toda a memória unificada; segundo as discussões no repositório llama.cpp, o Metal disponibiliza por padrão entre dois terços e três quartos dela. Em uma máquina de 16 GB, conte com cerca de 10 a 12 GB para o modelo e seu contexto.
| Memória | Disponível para o modelo (estimativa) | O que cabe confortavelmente | O que cabe por pouco |
|---|---|---|---|
| 8 GB | 5 a 6 GB | Qwen 3.5 4B (2,3 GB), Gemma 4 2B (1,2 GB) | Granite 4.2 8B (4,6 GB), contexto curto |
| 16 GB | 10 a 12 GB | Qwen 3.5 9B (6 GB), Granite 4.2 8B, Gemma 4 12B (7 GB) | Modelos de 14 GB ou mais: não |
| 24 GB | 16 a 18 GB | Qwen 3.5 9B em Q8, Gemma 4 12B, modelos de 14 a 16 GB | Mistral Small 3.2 24B (14 GB) ou Qwen 3.5 27B (16 GB): carregam, mas são lentos |
A coluna “utilizável” é uma estimativa baseada na regra de dois terços a três quartos, não um valor fornecido pela Apple. A versão de 8 GB só se justifica se você souber que continuará usando apenas modelos pequenos; como não é possível adicionar memória depois, a versão de 16 GB é a escolha razoável para IA local. Para verificar se um modelo e seu contexto cabem, a calculadora de memória do site fornece o total.
#Qual modelo escolher e qual velocidade esperar
A taxa de geração é limitada pela largura de banda dividida pelo tamanho dos pesos lidos a cada token. Com 100 GB/s, um modelo de 4,6 GB tem um limite de cerca de 21 tokens por segundo, um de 6 GB de cerca de 16, e um de 14 GB de cerca de 7. Nas medições publicadas para um Llama 7B, o M3 atinge 21,34 tokens por segundo em Q4_0, o que equivale a cerca de 80% do limite. Trata-se de limites teóricos, não de garantias.
| Modelo (Q4) | Tamanho do modelo | Limite (100 ÷ peso) | Para lembrar |
|---|---|---|---|
| Qwen 3.5 4B | 2,3 GB | cerca de 43 t/s | Muito fluido, respostas curtas e rápidas |
| Granite 4.2 8B | 4,6 GB | aproximadamente 21 t/s | Bom equilíbrio para bate-papo e síntese |
| Qwen 3.5 9B | 6 GB | cerca de 16 t/s | A opção de 16 GB para priorizar a qualidade |
| Gemma 4 12B | 7 GB | cerca de 14 t/s | Funciona de forma satisfatória com 16 GB e um contexto moderado |
| Mistral Small 3.2 24B | 14 GB | cerca de 7 t/s | Legível, mas já não é um uso interativo |
| Qwen 3.5 27B | 16 GB | cerca de 6 t/s | Reservado para tarefas longas com 24 GB |
Se o resultado for muito lento, a solução não está em um ajuste, mas no tamanho do modelo: passar de 9B para 4B praticamente dobra a taxa de geração. Para programação, um modelo especializado de 7 a 9B é mais útil do que um 24B lento demais para ser usado em tempo real. A tabela de velocidade do site (/benchmarks) reúne as medições publicadas por hardware.
#Sem ventoinha: o calor limita as gerações longas
O MacBook Air não tem ventilador. Para uma pergunta curta, você não perceberá isso. Para um resumo de várias dezenas de páginas ou uma geração de vários minutos, o chip aquece e acaba reduzindo sua frequência e, consequentemente, sua taxa de processamento. O fenômeno depende do cômodo, da carga e do ambiente; não temos nenhuma medição para citar, e é melhor verificar isso na sua máquina com uma geração longa.
- Colocar a máquina sobre um suporte com ventilação
- Um suporte em alumínio ou uma superfície dura ajuda o chassi a dissipar o calor; um sofá ou uma cama o impede.
- Planejar pausas
- Em tarefas longas, divida o trabalho em lotes em vez de fazer uma única geração de vários minutos.
- Reduzir o modelo
- Um modelo de 4B ou 8B aquece muito menos do que um modelo que satura a largura de banda continuamente.
- Conectar à tomada
- Quando o computador está funcionando com bateria, o macOS pode limitar o desempenho para economizar energia.
#Instalar Ollama e iniciar um primeiro modelo
Ollama exige macOS Sonoma (14) ou mais recente. A maneira mais simples é baixar o aplicativo no site oficial; o guia de instalação detalha a alternativa via Homebrew. Depois de iniciado, o aplicativo escuta na porta 11434 da máquina, e os modelos são baixados com um único comando.
- 01Instalar OllamaBaixe a aplicação ou siga o guia de instalação no macOS, depois inicie-a pela primeira vez.
- 02Escolher um modelo de acordo com a memória8 GB: um modelo com 3 a 4 bilhões de parâmetros. 16 GB: um 8B (5,2 GB na biblioteca Ollama). 24 GB: um 14B (9,3 GB) ou mais.
- 03Iniciar a geraçãoExecute ollama run seguido do nome do modelo: o download ocorre na primeira chamada.
- 04Verificar a memória durante o usoAbra o Monitor de Atividade, na aba Memória: a pressão da memória deve permanecer verde. Se passar para amarelo ou vermelho, o modelo é grande demais ou o contexto é longo demais.
A biblioteca Ollama indica 5,2 GB para qwen3:8b e 9,3 GB para qwen3:14b. O segundo é adequado para um MacBook Air de 24 GB, não para um de 16 GB, onde deixa muito pouco espaço disponível. Se você quiser testar MLX em vez de Ollama, o guia dedicado explica as diferenças e as limitações de cada ferramenta.
#Dois ajustes do Ollama que fazem a diferença com 16 GB
O primeiro é o tamanho do contexto. A FAQ oficial do Ollama indica uma janela padrão de 4.096 tokens, que pode ser alterada; ampliá-la consome memória para o cache. Para documentos longos, aumente-a progressivamente em vez de definir um valor máximo. O segundo é a quantização do cache KV: segundo a mesma FAQ, o Ollama aceita a variável OLLAMA_KV_CACHE_TYPE com o valor q8_0, que utiliza aproximadamente metade da memória do formato f16 padrão, desde que o Flash Attention esteja ativado.
No Mac, a FAQ esclarece que, quando o Ollama roda como aplicativo, as variáveis são definidas com launchctl e, em seguida, o aplicativo deve ser reiniciado. O guia de otimização para Macs com Apple Silicon complementa esses ajustes no macOS.
#MLX ou Ollama no MacBook Air M3
MLX é o framework de aprendizado de máquina da Apple para seus chips. É adequado para desenvolvedores que querem controlar o modelo via Python ou fazer um ajuste fino com LoRA localmente. O Ollama cuida do download, do carregamento e da API; é o ponto de entrada mais simples. As diferenças de velocidade entre os dois dependem do modelo e da versão: em vez de prometer um percentual, consulte a comparação detalhada do site.
#É necessário passar para um MacBook Air M4 ou superior?
O M4 aumenta a largura de banda para 120 GB/s de acordo com a tabela do llama.cpp, ou seja, 20% a mais do que o M3: nessa tabela, um Llama 7B em Q4_0 passa de 21,34 para 24,11 tokens por segundo. A diferença é perceptível nos modelos de 8B ou mais, mas não representa uma mudança radical. A verdadeira limitação do M3 continua sendo a memória, não a velocidade.
| Sua situação | Recomendação |
|---|---|
| Air M3 16 GB, uso de chat e síntese em 8-9B | Mantenha-o: o ganho de um M4 é de aproximadamente 20% no throughput |
| Air M3 de 8 GB, interesse em modelos de 8B ou mais | Mude para 16 GB ou mais: a memória é o limite |
| Necessidade de rodar um modelo de 24 a 32B com folga | Um Mac com mais largura de banda e memória (MacBook Pro, Mac mini M4 Pro) |
| Gerações longas contínuas | Um Mac com ventoinha, para evitar a redução de frequência |
- MacBook Air M4: o sucessor
- MacBook Air M2: a geração anterior
- MacBook Pro M2: com ventoinha
- Configurações do macOS para Apple Silicon
- Fonte: ficha técnica do MacBook Air M3 (Apple)
- Fonte: medições do llama.cpp em chips Apple
- Fonte: FAQ oficial do Ollama
#Perguntas frequentes
O MacBook Air M3 consegue rodar um LLM de 70B?+
Qual a velocidade esperada em um MacBook Air M3?+
MacBook Air M3 8 GB ou MacBook Air M2 16 GB para IA local?+
É possível usar o Neural Engine para rodar LLMs?+
O MacBook Air M3 aquece demais para uso local de IA?+
Qual modelo usar para programar em um MacBook Air M3 com 16 GB?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.