Mac Studio M5 Max / M5 Ultra: teste e avaliação para IA local
A primeira máquina voltada ao consumidor que roda um modelo de fronteira localmente. Vamos ver o que importa para rodar LLMs localmente : memória, largura de banda, velocidade, preço — e para quem é (ou não) a compra certa.
Atualizado em 09/10/2026
Onde comprar
A configuração indicada no botão é a oferecida na compra. Em mini-PCs, reserve memória para o sistema e verifique o motor de inferência; macOS/MLX e CUDA não são intercambiáveis.
Links afiliados — QualLLM pode receber uma comissão sobre as compras, sem custo adicional para você, o que não influencia estas recomendações (estabelecidas de forma independente). Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
Ficha técnica
- MemóriaM5 Max: 36 a 128 GB · M5 Ultra: 96 a 512 GB de memória unificada (a opção de 512 GB chega no final de outubro)
- Largura de bandaM5 Max: 460 GB/s (GPU de 32 núcleos) / 614 GB/s (GPU de 40 núcleos) · M5 Ultra: até 1,2 TB/s (+50% em relação à geração anterior)
- CálculoM5 Max : CPU com 18 núcleos, GPU até 40 núcleos · M5 Ultra : CPU com 36 núcleos, GPU com 80 núcleos, Neural Engine com 32 núcleos — Aceleradores Neurais em cada núcleo de GPU, Thunderbolt 5, SSD PCIe Gen 6
- ConsumoComputador de mesa, refrigeração silenciosa
- Preço indicativo2.999 € (M5 Max 36 GB / 512 GB) · 6.599 € (M5 Ultra 96 GB / 1 TB) — até ≈ 20.000 € em 512 GB / 16 TB
- Maior modelo36 GB: classe 30B · 64-96 GB: 70B em Q4 · 128 GB: GPT-OSS-120B com folga · 256 GB: Qwen3-235B (MoE) · 512 GB: MoE de fronteira ~600B em Q4, classe DeepSeek — cf. tabela de níveis
Para quem?
Vantagens e limitações
✓ Pontos fortes
- 512 GB de memória unificada a 1,2 TB/s: um modelo de ~600 bilhões de parâmetros (Q4) cabe inteiro localmente — inédito fora de servidor
- Apple anuncia até 4,3× o desempenho de IA da geração anterior (Aceleradores Neurais por núcleo de GPU)
- macOS + MLX: o ecossistema de LLMs locais mais otimizado para Apple (LM Studio, Ollama, mlx-lm)
- Silencioso, compacto, baixo consumo de energia para a capacidade — nenhum computador em torre com múltiplas GPUs comporta 512 GB de VRAM
- Thunderbolt 5 e SSD PCIe Gen 6: carregamento dos pesos muito mais rápido
✗ Limitações
- A versão de 512 GB só será enviada no fim de outubro de 2026 (as demais, a partir de 22/09)
- Preço da Apple: a configuração de 512 GB ultrapassa em muito os 10.000 € — reservada a usos profissionais sérios
- Abaixo de 96 GB, um mini-PC Strix Halo de 128 GB (≈ 3 300 a 4 000 €) oferece mais memória por euro
- Sem CUDA: o fine-tuning pesado e algumas ferramentas continuam sendo mais simples de usar com NVIDIA
Qual nível de memória para quais modelos?
A regra: a memória define o tamanho do modelo que pode ser carregado, a banda passante determina a velocidade de geração. As velocidades são dadas como ordens de grandeza para a geração de texto (decodificação), com quantização Q4, via MLX / llama.cpp — os modelos MoE utilizam apenas seus parâmetros ativos, daí suas altas taxas de geração.
| Configuração | Largura de banda | O que roda (Q4) | Velocidade estimada |
|---|---|---|---|
| M5 Max 36 GB | 460 GB/s | Classe 30B: Qwen3-32B, GLM-4.7-Flash | ~25-35 tok/s |
| M5 Max 64 GB | 614 GB/s (GPU 40 c.) | 70B em Q4 (~40 GB); MoE 30B-A3B muito rápidos | ~13-16 tok/s (70B) · 80+ tok/s (MoE A3B) |
| M5 Max 128 GB | 614 GB/s | 70B em Q8, GPT-OSS-120B (MXFP4), contexto longo | ~40-60 tok/s (GPT-OSS-120B) |
| M5 Ultra 96 GB | 1,2 TB/s | 70B em Q4 com margem de contexto | ~25-30 tok/s |
| M5 Ultra 256 GB | 1,2 TB/s | Qwen3-235B-A22B em Q4 (~135 GB) | ~25-35 tok/s |
| M5 Ultra 512 GB | 1,2 TB/s | MoE de ponta ~600B em Q4 (classe DeepSeek, ~380-400 GB) | ~15-20 tok/s |
O pré-preenchimento (leitura do prompt) aproveita também os Neural Accelerators da GPU M5 — era o ponto fraco histórico dos Macs diante das GPUs NVIDIA em contextos longos.
M5 Max ou M5 Ultra ?
Le M5 Max (2.999 € com 36 GB, BTO até 128 GB) atende a modelos de até 70B e MoE de ~120B: é a escolha racional para uso exigente em desenvolvimento/copiloto/RAG. Escolha obrigatoriamente a GPU de 40 núcleos assim que você ultrapassar 36 GB: a largura de banda passa de 460 para 614 GB/s, ou seja, um aumento de um terço na velocidade de cada token.
Le M5 Ultra (6 599 € com 96 GB) só se justifica pela memória: com 96 GB, ele é apenas um pouco melhor que um M5 Max de 128 GB mais barato. Sua verdadeira razão de ser são os patamares 256 e 512 GB — os únicos que permitem executar modelos MoE de 235 a ~600 bilhões de parâmetros. Se você não tem um uso específico para esses modelos, o Ultra é uma compra ruim; se tem, é o único hardware de desktop que permite isso.
Em comparação com as alternativas
| Máquina | Memória | Largura de banda | Preço | Uso correto |
|---|---|---|---|---|
| Mac Studio M5 Max | 36-128 GB | 460-614 GB/s | a partir de 2.999 € | 70B e MoE ~120B rápidos, ecossistema MLX |
| Mac Studio M5 Ultra | 96-512 GB | 1,2 TB/s | a partir de 6.599 € | MoE 235-600B: sem equivalente em computadores de mesa |
| Mini-PC Strix Halo | 64-128 GB | 212 GB/s | ≈ 2 000-4 000 € | Melhor relação memória/euro (70B lento mas acessível) |
| NVIDIA DGX Spark | 128 GB | 273 GB/s | ≈ 6 100 – 6 600 € | Ecossistema CUDA obrigatório, fine-tuning |
| RTX 5090 | 32 GB | 1,79 TB/s | ≈ 5 700 € | Velocidade bruta até ~32B, não além disso |
Resumindo: velocidade pura em modelos pequenos → GPU dedicada; capacidade máxima por euro → Strix Halo; capacidade máxima em geral → M5 Ultra.
Disponibilidade: o que você precisa saber
- À venda desde 22 de setembro de 2026 (pré-vendas abertas em 25 de agosto).
- O nível 512 GB só será enviado no fim de outubro — faça seu pedido com antecedência se essa for a configuração que você deseja.
- Nas lojas francesas: M5 Max 36 GB / 512 GB na Darty e M5 Max 96 GB / 512 GB no Materiel.net; as outras opções de memória passam pelo configurador BTO da Apple Store.
- O Mac Studio M4 Max 36 GB / 512 GB não está mais disponível novo no estoque dos nossos lojistas (verificado no final de setembro de 2026) — nossa ficha M4 Max para comparar.
Veredito
Perguntas frequentes
O Mac Studio M5 Max / M5 Ultra consegue rodar um LLM de 70B localmente?
36 GB: classe 30B · 64-96 GB: 70B em Q4 · 128 GB: GPT-OSS-120B com folga · 256 GB: Qwen3-235B (MoE) · 512 GB: MoE de ponta ~600B em Q4, classe DeepSeek — consulte a tabela de níveis.
Quanto custa o Mac Studio M5 Max / M5 Ultra?
Conte com 2.999 € (M5 Max 36 GB / 512 GB) · 6.599 € (M5 Ultra 96 GB / 1 TB) — até aproximadamente 20.000 € na configuração de 512 GB / 16 TB (a partir de US$ 2.499 (M5 Max) · US$ 5.499 (M5 Ultra)). Os preços mudam rapidamente — verifique o preço atual pelos links de compra.
Para quem o Mac Studio M5 Max / M5 Ultra é indicado?
Desenvolvedores e criadores que usam macOS e querem executar LLMs grandes em uma estação fixa — da classe 30B (36 GB) até modelos MoE de ponta com cerca de 600B em Q4 (512 GB).
É possível rodar um modelo da classe DeepSeek localmente no Mac Studio M5?
Sim, essa é A grande novidade: com 512 GB de memória unificada, um modelo MoE de fronteira com cerca de 600 bilhões de parâmetros, quantizado em Q4 (~380-400 GB de pesos), cabe por inteiro, com uma geração estimada de 15-20 tok/s graças à arquitetura MoE (apenas os parâmetros ativos são lidos a cada token). Veja também nosso guia sobre DeepSeek V4 Flash.
Você ainda pode escolher o Mac Studio M4 Max em vez do M5?
Não está mais disponível como novo nos nossos revendedores: o M4 Max 36 GB / 512 GB, vendido em liquidação por 2.219 € durante o verão, não está mais em estoque no final de setembro de 2026. O M5 Max assume o lugar por 2.999 €: maior largura de banda, Neural Accelerators e níveis de memória até 128 GB, que o M4 Max não possui mais.
Por que a memória unificada vence um GPU para modelos grandes?
Uma GPU dedicada tem um limite de 32 GB de VRAM (RTX 5090): acima disso, é necessário transferir parte do modelo para a RAM pelo barramento PCIe, e a velocidade despenca. A memória unificada da Apple dá à GPU acesso direto à totalidade dos 96–512 GB: o modelo inteiro continua com acesso à largura de banda total. Isso é mais lento que uma VRAM GDDR7 de mesma capacidade, mas é a única abordagem para computadores de mesa que comporta os modelos gigantes.