Iniciante 11 minMacBook Air

Qual LLM no MacBook Air M3 (8 / 16 / 24 GB) ?

Resposta direta

IA local no MacBook Air M3: com 16 GB de memória unificada, um modelo com 8 a 9 bilhões de parâmetros em Q4 roda com folga; com 8 GB, limite-se a modelos de 3–4B; com 24 GB, um modelo de 24B carrega, mas a largura de banda de 100 GB/s o torna lento. O M3 não é mais rápido que o M2 para gerar texto: as medições publicadas mostram taxas de geração quase idênticas. Não o confunda com Apple Intelligence, que é um serviço diferente.

O MacBook Air M3 é o notebook Apple mais usado para testar IA local. É silencioso, sem ventilador, e consegue rodar modelos de 8 a 9 bilhões de parâmetros sem problemas. A seguir, o que cada configuração de memória permite, o que os dados publicados dizem sobre a velocidade, o que não mudou desde o M2 e os ajustes que realmente importam.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no macOS 14+
Hardware recomendado

Opção de compra para este guia: MacBook Pro M5 Pro — 24 GB / 1 TB.

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#MacBook Air M3 em 2026: a ficha técnica útil para os LLM

De acordo com a ficha técnica da Apple, o chip M3 do MacBook Air combina uma CPU com 8 núcleos (4 de desempenho e 4 de eficiência), uma GPU com 8 ou 10 núcleos, um Neural Engine com 16 núcleos e uma largura de banda de memória de 100 GB/s. A memória unificada é soldada: a Apple lista duas configurações de entrada, 8 GB ou 16 GB, ambas ampliáveis para 24 GB no momento da compra. O modelo está disponível em versões de 13 e 15 polegadas com o mesmo chip.

Largura de banda
100 GB/s, igual à do M2. É ela, mais do que o número de núcleos do GPU, que limita a velocidade de geração.
Refrigeração
Sem ventoinha. O chip só consegue dissipar o calor pelo chassi: durante uma geração longa, ele acaba reduzindo sua frequência.
Neural Engine
16 núcleos, mas as ferramentas comuns de IA local (Ollama, llama.cpp, LM Studio) usam a GPU via Metal, não o Neural Engine.
Novidade do M3
O Dynamic Caching, que aloca em tempo real a memória local da GPU. Não temos medições do seu efeito nos LLMs e não prometemos nenhum efeito.
i
O que o M3 não mudou
O M3 mantém os 100 GB/s do M2. A tabela de medições do llama.cpp confirma: um Llama 7B em Q4_0 gera 21,34 tokens por segundo no M3 contra 21,91 no M2 (Q8_0: 12,27 contra 12,21). Passar de um Air M2 para um Air M3 não acelera, portanto, a geração de texto. A largura de banda só muda com o M4, a 120 GB/s.

#IA local ou Apple Intelligence: duas coisas diferentes

O kit Mac

IA local no seu Mac, a fundo: memória unificada, MLX vs GGUF, o modelo certo para seu chip, Ollama e LM Studio ajustados para Apple Silicon.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Muitas pesquisas sobre o MacBook Air M3 tratam de “IA” no sentido amplo. Apple Intelligence é o conjunto de funções integrado ao macOS (resumos, escrita, Siri); segundo a Apple, ele funciona em Macs equipados com um chip M1 ou mais recente, portanto também no MacBook Air M3. Ele não permite que você escolha o modelo, exponha uma API ou trabalhe com seus próprios documentos usando um modelo aberto.

A IA local, mencionada neste guia, consiste em baixar um modelo aberto (Qwen, Gemma, Granite, Mistral) e executá-lo com Ollama, LM Studio ou MLX. Você escolhe o modelo, o tamanho do contexto e o que fica na máquina. Os dois podem coexistir; a memória é, no entanto, compartilhada, e um modelo com 9 bilhões de parâmetros carregado reduz o que resta para macOS e para os aplicativos.

#Quantidade de memória: 8, 16 ou 24 GB

A memória é o primeiro critério, porque um modelo que excede a capacidade disponível não fica mais lento: ele se torna inutilizável. No Apple Silicon, a GPU não consegue usar toda a memória unificada; segundo as discussões no repositório llama.cpp, o Metal disponibiliza por padrão entre dois terços e três quartos dela. Em uma máquina de 16 GB, conte com cerca de 10 a 12 GB para o modelo e seu contexto.

O que cada configuração permite (peso em Q4 do catálogo QuelLLM)
MemóriaDisponível para o modelo (estimativa)O que cabe confortavelmenteO que cabe por pouco
8 GB5 a 6 GBQwen 3.5 4B (2,3 GB), Gemma 4 2B (1,2 GB)Granite 4.2 8B (4,6 GB), contexto curto
16 GB10 a 12 GBQwen 3.5 9B (6 GB), Granite 4.2 8B, Gemma 4 12B (7 GB)Modelos de 14 GB ou mais: não
24 GB16 a 18 GBQwen 3.5 9B em Q8, Gemma 4 12B, modelos de 14 a 16 GBMistral Small 3.2 24B (14 GB) ou Qwen 3.5 27B (16 GB): carregam, mas são lentos

A coluna “utilizável” é uma estimativa baseada na regra de dois terços a três quartos, não um valor fornecido pela Apple. A versão de 8 GB só se justifica se você souber que continuará usando apenas modelos pequenos; como não é possível adicionar memória depois, a versão de 16 GB é a escolha razoável para IA local. Para verificar se um modelo e seu contexto cabem, a calculadora de memória do site fornece o total.

#Qual modelo escolher e qual velocidade esperar

A taxa de geração é limitada pela largura de banda dividida pelo tamanho dos pesos lidos a cada token. Com 100 GB/s, um modelo de 4,6 GB tem um limite de cerca de 21 tokens por segundo, um de 6 GB de cerca de 16, e um de 14 GB de cerca de 7. Nas medições publicadas para um Llama 7B, o M3 atinge 21,34 tokens por segundo em Q4_0, o que equivale a cerca de 80% do limite. Trata-se de limites teóricos, não de garantias.

Limite máximo teórico com 100 GB/s, conforme o tamanho dos pesos
Modelo (Q4)Tamanho do modeloLimite (100 ÷ peso)Para lembrar
Qwen 3.5 4B2,3 GBcerca de 43 t/sMuito fluido, respostas curtas e rápidas
Granite 4.2 8B4,6 GBaproximadamente 21 t/sBom equilíbrio para bate-papo e síntese
Qwen 3.5 9B6 GBcerca de 16 t/sA opção de 16 GB para priorizar a qualidade
Gemma 4 12B7 GBcerca de 14 t/sFunciona de forma satisfatória com 16 GB e um contexto moderado
Mistral Small 3.2 24B14 GBcerca de 7 t/sLegível, mas já não é um uso interativo
Qwen 3.5 27B16 GBcerca de 6 t/sReservado para tarefas longas com 24 GB

Se o resultado for muito lento, a solução não está em um ajuste, mas no tamanho do modelo: passar de 9B para 4B praticamente dobra a taxa de geração. Para programação, um modelo especializado de 7 a 9B é mais útil do que um 24B lento demais para ser usado em tempo real. A tabela de velocidade do site (/benchmarks) reúne as medições publicadas por hardware.

#Sem ventoinha: o calor limita as gerações longas

O MacBook Air não tem ventilador. Para uma pergunta curta, você não perceberá isso. Para um resumo de várias dezenas de páginas ou uma geração de vários minutos, o chip aquece e acaba reduzindo sua frequência e, consequentemente, sua taxa de processamento. O fenômeno depende do cômodo, da carga e do ambiente; não temos nenhuma medição para citar, e é melhor verificar isso na sua máquina com uma geração longa.

Colocar a máquina sobre um suporte com ventilação
Um suporte em alumínio ou uma superfície dura ajuda o chassi a dissipar o calor; um sofá ou uma cama o impede.
Planejar pausas
Em tarefas longas, divida o trabalho em lotes em vez de fazer uma única geração de vários minutos.
Reduzir o modelo
Um modelo de 4B ou 8B aquece muito menos do que um modelo que satura a largura de banda continuamente.
Conectar à tomada
Quando o computador está funcionando com bateria, o macOS pode limitar o desempenho para economizar energia.

#Instalar Ollama e iniciar um primeiro modelo

Ollama exige macOS Sonoma (14) ou mais recente. A maneira mais simples é baixar o aplicativo no site oficial; o guia de instalação detalha a alternativa via Homebrew. Depois de iniciado, o aplicativo escuta na porta 11434 da máquina, e os modelos são baixados com um único comando.

  1. 01
    Instalar Ollama
    Baixe a aplicação ou siga o guia de instalação no macOS, depois inicie-a pela primeira vez.
  2. 02
    Escolher um modelo de acordo com a memória
    8 GB: um modelo com 3 a 4 bilhões de parâmetros. 16 GB: um 8B (5,2 GB na biblioteca Ollama). 24 GB: um 14B (9,3 GB) ou mais.
  3. 03
    Iniciar a geração
    Execute ollama run seguido do nome do modelo: o download ocorre na primeira chamada.
  4. 04
    Verificar a memória durante o uso
    Abra o Monitor de Atividade, na aba Memória: a pressão da memória deve permanecer verde. Se passar para amarelo ou vermelho, o modelo é grande demais ou o contexto é longo demais.
Primeiro modelo com 16 GB
ollama run qwen3:8b

A biblioteca Ollama indica 5,2 GB para qwen3:8b e 9,3 GB para qwen3:14b. O segundo é adequado para um MacBook Air de 24 GB, não para um de 16 GB, onde deixa muito pouco espaço disponível. Se você quiser testar MLX em vez de Ollama, o guia dedicado explica as diferenças e as limitações de cada ferramenta.

#Dois ajustes do Ollama que fazem a diferença com 16 GB

O primeiro é o tamanho do contexto. A FAQ oficial do Ollama indica uma janela padrão de 4.096 tokens, que pode ser alterada; ampliá-la consome memória para o cache. Para documentos longos, aumente-a progressivamente em vez de definir um valor máximo. O segundo é a quantização do cache KV: segundo a mesma FAQ, o Ollama aceita a variável OLLAMA_KV_CACHE_TYPE com o valor q8_0, que utiliza aproximadamente metade da memória do formato f16 padrão, desde que o Flash Attention esteja ativado.

Reduzir o cache de contexto pela metade
launchctl setenv OLLAMA_FLASH_ATTENTION 1
launchctl setenv OLLAMA_KV_CACHE_TYPE q8_0
# puis quitter et relancer l'application Ollama

No Mac, a FAQ esclarece que, quando o Ollama roda como aplicativo, as variáveis são definidas com launchctl e, em seguida, o aplicativo deve ser reiniciado. O guia de otimização para Macs com Apple Silicon complementa esses ajustes no macOS.

#MLX ou Ollama no MacBook Air M3

MLX é o framework de aprendizado de máquina da Apple para seus chips. É adequado para desenvolvedores que querem controlar o modelo via Python ou fazer um ajuste fino com LoRA localmente. O Ollama cuida do download, do carregamento e da API; é o ponto de entrada mais simples. As diferenças de velocidade entre os dois dependem do modelo e da versão: em vez de prometer um percentual, consulte a comparação detalhada do site.

#É necessário passar para um MacBook Air M4 ou superior?

O M4 aumenta a largura de banda para 120 GB/s de acordo com a tabela do llama.cpp, ou seja, 20% a mais do que o M3: nessa tabela, um Llama 7B em Q4_0 passa de 21,34 para 24,11 tokens por segundo. A diferença é perceptível nos modelos de 8B ou mais, mas não representa uma mudança radical. A verdadeira limitação do M3 continua sendo a memória, não a velocidade.

Quando manter seu Air M3, quando trocar
Sua situaçãoRecomendação
Air M3 16 GB, uso de chat e síntese em 8-9BMantenha-o: o ganho de um M4 é de aproximadamente 20% no throughput
Air M3 de 8 GB, interesse em modelos de 8B ou maisMude para 16 GB ou mais: a memória é o limite
Necessidade de rodar um modelo de 24 a 32B com folgaUm Mac com mais largura de banda e memória (MacBook Pro, Mac mini M4 Pro)
Gerações longas contínuasUm Mac com ventoinha, para evitar a redução de frequência

#Perguntas frequentes

FAQ
O MacBook Air M3 consegue rodar um LLM de 70B?+
Não, não de forma utilizável. Um modelo 70B em Q4 pesa aproximadamente 40 GB, bem mais que os 24 GB máximos do MacBook Air M3. Mesmo com uma quantização muito agressiva, não caberia. O limite razoável nessa máquina é um modelo de 24 a 27B com 24 GB, com execução lenta, e um modelo de 8 a 9B com 16 GB para um uso fluido.
Qual a velocidade esperada em um MacBook Air M3?+
Com um Llama 7B em Q4_0, a tabela de medições do llama.cpp indica 21,34 tokens por segundo para um M3 com 10 núcleos de GPU. Um modelo maior será mais lento; um modelo de 4B será aproximadamente duas vezes mais rápido. São medições feitas por usuários com um modelo antigo e devem ser interpretadas como uma ordem de grandeza.
MacBook Air M3 8 GB ou MacBook Air M2 16 GB para IA local?+
O M2 de 16 GB, sem hesitar. Os dois chips têm a mesma largura de banda de 100 GB/s, então o M3 não gera mais rápido, enquanto 16 GB permitem carregar um modelo de 8–9B que não cabe com folga em 8 GB. A memória é o critério decisivo.
É possível usar o Neural Engine para rodar LLMs?+
Não com as ferramentas comuns. O Ollama, o llama.cpp e o LM Studio executam o modelo na GPU via Metal. O Neural Engine de 16 núcleos serve principalmente para tarefas do Core ML, como visão ou reconhecimento de voz, e não é o caminho para acelerar um LLM de conversa neste Mac.
O MacBook Air M3 aquece demais para uso local de IA?+
Ele não tem ventoinha, então acaba reduzindo sua frequência durante gerações longas. Para perguntas curtas, você não perceberá isso. Para tarefas longas, coloque-o em um suporte que dissipe o calor, conecte-o à tomada e escolha um modelo menor. Uma máquina com ventoinha é preferível para uso contínuo.
Qual modelo usar para programar em um MacBook Air M3 com 16 GB?+
Um modelo de código com 7 a 9 bilhões de parâmetros em Q4, cerca de 5 a 6 GB, deixa espaço para o contexto dos seus arquivos. Um 14B em Q4 (cerca de 9 GB) é uma possibilidade se você aceitar uma taxa de geração menor. Acima disso, o contexto longo consome a margem restante e a velocidade fica baixa demais para a digitação assistida.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.