Ferramenta · Apple Silicon M1 a M6
Qual LLM pode rodar no meu Mac ?
Escolha seu chip e sua memória: a ferramenta lista os modelos do catálogo que cabem, com a quantização a usar e a velocidade esperada.
Seu Mac
Carregando o catálogo…
O que roda conforme a memória do seu Mac
A memória unificada é compartilhada entre o macOS e os modelos. Por padrão, a GPU pode usar cerca de dois terços em configurações com até 32 GB e três quartos acima disso. Sugestão: o maior e mais recente modelo que caiba em Q4 com um contexto de 8K.
| Memória | Utilizável | Sugestão (Q4) |
|---|---|---|
| 8 GB | ≈ 5,4 GB | LFM2.5 7B · classificação para 8 GB |
| 16 GB | ≈ 11 GB | Nemotron 3 Super 12B · ranking para 16 GB |
| 24 GB | ≈ 16 GB | Devstral Small 2 24B · ranking para 24 GB |
| 32 GB | ≈ 21 GB | Laguna XS.2 · ranking para 32 GB |
| 36 GB | ≈ 27 GB | Qwen 3.6 35B-A3B |
| 48 GB | ≈ 36 GB | Qwen 3.6 35B-A3B · ranking para 48 GB |
| 64 GB | ≈ 48 GB | Nemotron 3 Puzzle 75B-A9B · ranking para 64 GB |
| 96 GB | ≈ 72 GB | Laguna S 2.1 · ranking de 96 GB |
| 128 GB | ≈ 96 GB | Mistral Medium 3.5 128B · classificação para 128 GB |
| 192 GB | ≈ 144 GB | MiniMax-M2.7 |
| 256 GB | ≈ 192 GB | GLM 5.3 Flash 320B-A18B |
| 512 GB | ≈ 384 GB | Nemotron 3 Ultra (BF16) |
A velocidade depende do chip
A cada palavra gerada, o Mac relê todo o modelo na memória: a largura de banda define, portanto, o limite de velocidade. Com a mesma quantidade de memória, um chip Max ou Ultra é várias vezes mais rápido que um chip básico.
| Chip | Largura de banda | Memórias sugeridas |
|---|---|---|
| M1 | 68 GB/s | 8, 16 GB |
| M1 Pro | 200 GB/s | 16, 32 GB |
| M1 Max | 400 GB/s | 32, 64 GB |
| M1 Ultra | 800 GB/s | 64, 128 GB |
| M2 | 100 GB/s | 8, 16, 24 GB |
| M2 Pro | 200 GB/s | 16, 32 GB |
| M2 Max | 400 GB/s | 32, 64, 96 GB |
| M2 Ultra | 800 GB/s | 64, 128, 192 GB |
| M3 | 100 GB/s | 8, 16, 24 GB |
| M3 Pro | 150 GB/s | 18, 36 GB |
| M3 Max | 300 a 400 GB/s | 36, 48, 64, 96, 128 GB |
| M3 Ultra | 819 GB/s | 96, 256, 512 GB |
| M4 | 120 GB/s | 16, 24, 32 GB |
| M4 Pro | 273 GB/s | 24, 48, 64 GB |
| M4 Max | 410 a 546 GB/s | 36, 48, 64, 128 GB |
| M5 | 153 GB/s | 16, 24, 32 GB |
| M5 Pro | 307 GB/s | 24, 48, 64 GB |
| M5 Max | 460 a 614 GB/s | 36, 48, 64, 96, 128 GB |
| M5 Ultra | 1200 GB/s | 96, 256, 512 GB |
| M6 | 170 GB/s | 16, 24, 32 GB |
Dois valores: a versão com menos núcleos de GPU (e menos memória) tem menor largura de banda. Fontes: fichas técnicas da Apple; M5 e M6: nossas fichas Mac Studio M5 et Mac mini M6.
Perguntas frequentes
Um Mac com 8 GB consegue rodar um LLM?
Sim, mas apenas modelos pequenos: cerca de 5 GB estão disponíveis para os modelos, o que permite acomodar um modelo de 3 a 4 bilhões de parâmetros em Q4 (Qwen 3 4B, Gemma 3 4B). A partir de 16 GB, modelos de 7 a 8 bilhões de parâmetros passam a rodar com folga.
Que parte da memória unificada a GPU pode utilizar?
Por padrão, o macOS reserva cerca de um terço da memória para o sistema nos Macs com até 32 GB, e um quarto acima disso. Um Mac de 24 GB oferece, portanto, cerca de 16 GB para os modelos; um Mac de 96 GB, cerca de 72 GB. O comando sysctl iogpu.wired_limit_mb permite aumentar esse limite, deixando memória suficiente para o macOS.
Por que dois Macs com a mesma memória não têm a mesma velocidade?
Porque a velocidade de geração depende principalmente da largura de banda da memória: 120 GB/s em um M4, 273 GB/s em um M4 Pro e 546 GB/s em um M4 Max. A cada palavra, a máquina relê todo o modelo. Um M4 Max, portanto, é cerca de 4 vezes mais rápido que um M4 com um modelo que cabe em ambos.
MLX, Ollama ou LM Studio no Mac?
Os três funcionam. O MLX, framework da Apple, costuma ser o mais rápido no Apple Silicon; o LM Studio o disponibiliza com uma interface gráfica; o Ollama é o mais simples na linha de comando e se integra a muitas ferramentas.