Intermediário 14 minApple

MacBook Pro M5 Max 128 GB: as verdadeiras medições em IA local (benchmark 2026)

Um MacBook Pro M5 Max com GPU de 40 núcleos e 128 GB de memória unificada, um protocolo escrito com antecedência, seis modelos, um documento de 16 689 tokens: aqui estão as primeiras medições públicas em francês sobre o maior notebook da Apple para IA local. As medições foram realizadas por Joël Ramat, consultor de cibersegurança e GRC, em sua própria máquina, a nosso pedido e segundo nosso protocolo. Todos os números são as saídas brutas do Ollama, sem alterações.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-16·Testado no macOS 14+
Hardware recomendado

O MacBook Pro M5 Max está em estoque hoje: MacBook Pro M5 Max — 36 GB / 2 TB.

Por que essa escolha? Nossa ficha completa sobre MacBook Pro M5 Max — 36 GB / 2 TB →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

MacBook Pro aberto em uma mesa escura, terminal exibindo geração de texto em andamento
Ilustração. A máquina testada é um MacBook Pro M5 Max de 128 GB com configuração de fábrica, sem nenhuma configuração do sistema alterada.
i
Por que esse guia existe
O M5 Max 128 GB é a única configuração do topo do nosso configurador na qual não conseguimos obter nenhum dado direto. Joël Ramat, leitor do kit Mac e proprietário da máquina, propôs fazer as medições. Escrevemos o protocolo, ele o executou em 16 de setembro de 2026, e publicamos aqui os resultados creditando-o como autor das medições.

#A máquina e o protocolo

Ficha da máquina: chip M5 Max, 40 núcleos GPU, 18 núcleos CPU, 614 GB/s, 128 GB de memória unificada, macOS 27.0, Ollama 0.34.1
A configuração exata, registrada por script antes da primeira medição. O número de núcleos do GPU é o ponto decisivo: apenas a versão com 40 núcleos atinge 614 GB/s.

A máquina é um MacBook Pro de 16 polegadas com o chip M5 Max completo: 18 núcleos de CPU, 40 núcleos de GPU e 128 GB de memória unificada com largura de banda anunciada de 614 GB/s. Ela roda macOS 27.0 com Ollama 0.34.1. Nenhum parâmetro do sistema foi modificado: o limite de memória da GPU é o padrão, o que importa ao comparar com seu próprio Mac.

O protocolo se resume a quatro regras, e elas não são decorativas. Mac conectado à tomada, porque o macOS limita o desempenho do chip quando funciona com bateria. Aplicativos pesados fechados. Apenas um modelo carregado de cada vez. E, sobretudo, o mesmo prompt para todas as séries, pois é ele que torna os números comparáveis entre modelos e, amanhã, entre máquinas.

Prompt comum a todas as séries
Explique en 300 mots la différence entre la mémoire unifiée d'un Mac et la VRAM d'un GPU dédié, pour un lecteur non technique.
Série A, as duas referências
Gemma 4 12B e Qwen 3.8 27B em GGUF, dois modelos que também rodam em Macs bem mais modestos. Eles permitem situar a máquina em uma escala conhecida.
Série B, MLX versus GGUF
O mesmo Qwen 3.8 27B, com os mesmos pesos, servido pelo motor MLX do Ollama em vez de llama.cpp. Apenas o motor muda.
Série C, o verdadeiro destaque da faixa de 128 GB
gpt-oss 120B, 65 GB, um modelo que simplesmente não cabe em um notebook PC.
Série D, o pré-preenchimento com carga real
Um documento de 16.689 tokens enviado de uma só vez ao gpt-oss 120B, com uma instrução para produzir uma síntese. É a única medição significativa de prefill da campanha.
Dois bônus fora do protocolo
Joël já tinha Qwen 3.6 35B-A3B em MLX e gpt-oss 20B na sua máquina. Ele os mediu nas mesmas condições.
→
O que medimos e o que não devemos confundir
O Ollama exibe duas taxas. O prefill (prompt eval rate) é a velocidade com que o modelo lê seu prompt antes de responder: ele determina a espera até a primeira palavra. A geração (eval rate) é a produção da resposta, token a token: ela determina a sensação de fluidez. Um modelo pode ser rápido em uma e lento na outra.

#Todos os números em uma tabela

O kit Mac

IA local no seu Mac, a fundo: memória unificada, MLX vs GGUF, o modelo certo para seu chip, Ollama e LM Studio ajustados para Apple Silicon.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Aqui estão as saídas brutas do comando ollama run --verbose, como Joël copiou após cada medição. Cada modelo gerou uma resposta completa ao prompt de 300 palavras, em modo de raciocínio quando o modelo o suporta, o que explica os 1.400 a 3.200 tokens gerados para 300 palavras de texto final.

M5 Max 40 GPU · 128 GB · Ollama 0.34.1 · conectado à tomada · duas execuções por modelo, segunda mantida · 16/09/2026
ModeloMotorTamanho do modeloGeraçãoTokens geradosDuração total
Gemma 4 12BGGUF Q47,6 GB58,1 tok/s1 39024 s
Qwen 3.8 27BGGUF Q417 GB36,6 tok/s2 51769 s
Qwen 3.8 27BMLX18 GB68,0 tok/s2 10331 s
Qwen 3.6 35B-A3B (bônus)MLX23 GB167,2 tok/s3 20519 s
gpt-oss 20B (bônus)MXFP413 GB113,4 tok/s2 19919 s
gpt-oss 120BMXFP465 GB79,1 tok/s6698,5 s
gpt-oss 120B, nova execução 1MXFP465 GB77,5 tok/s73212,5 s
gpt-oss 120B, reexecução 2MXFP465 GB75,5 tok/s1 70722,7 s
gpt-oss 120B, série DMXFP465 GB67,6 tok/s2 58450 s
Prefill: apenas a medição da série D é significativa (ver a seção Limites)
SérieTokens de promptPrefillTempo até a primeira palavra
A, B, C (prompt curto)43 à 9831 a 346 tok/s0,1 a 0,9 s: latência de inicialização, não um throughput
D, documento de 16.689 tokens16 6891 388 tok/s12,0 s
!
Por que o prefill de prompts curtos não é comentado
Cada modelo foi medido duas vezes e apenas a segunda medição foi conservada, conforme o protocolo: o carregamento do modelo e a compilação dos shaders Metal não estão incluídos na medição. Mas em um prompt de 43 a 98 tokens, o prefill ocorre em menos de um segundo: o número reflete uma latência fixa de inicialização, não uma taxa de leitura. São necessários milhares de tokens para que a taxa de leitura passe a predominar na medição, e esse é precisamente o foco da série D.

#Geração: seis modelos, uma leitura

Gráfico de barras da velocidade de geração: Qwen 3.6 35B-A3B 167 tokens por segundo, gpt-oss 20B 113, gpt-oss 120B 79, Qwen 3.8 27B MLX 68, Gemma 4 12B 58, Qwen 3.8 27B GGUF 37
Geração em tokens por segundo. Em laranja, os modelos MoE, que ativam apenas 3 a 5 bilhões de parâmetros por token; em azul, os modelos densos.

Se analisado de forma superficial, esse ranking é absurdo: um modelo de 120 bilhões de parâmetros a 79 tokens por segundo, duas vezes mais rápido que um 27B em GGUF. A explicação cabe em três letras. gpt-oss 120B, gpt-oss 20B e Qwen 3.6 35B-A3B são modelos com mistura de especialistas, MoE. A cada token, apenas uma fração dos parâmetros é acionada: cerca de 5 bilhões para gpt-oss 120B, 3,6 bilhões para gpt-oss 20B e 3 bilhões para o Qwen. A velocidade de geração depende do que se move na memória a cada token, não do que está em repouso.

Os modelos densos, Gemma 4 12B e Qwen 3.8 27B, utilizam todos os seus parâmetros a cada token. Sua velocidade segue, portanto, a largura de banda da memória dividida pelo peso do modelo: essa é a regra dos Macs desde o M1, e o M5 Max não escapa dela. Nesta máquina, um modelo denso de 27B em GGUF roda a 37 tokens por segundo, e um 12B, a 58.

167 tok/s em Qwen 3.6 35B-A3B com MLX
O número mais alto da campanha, no modelo que combina os dois aceleradores: arquitetura MoE e motor MLX. É a velocidade de um pequeno 8B, com o conhecimento geral de um 35B.
113 tok/s em gpt-oss 20B
O melhor equilíbrio entre velocidade, qualidade e peso para uso diário como assistente: 13 GB, uma resposta de 2.200 tokens em 19 segundos.
79 tok/s em gpt-oss 120B
O modelo mais capaz da lista, com velocidade duas vezes superior à leitura humana. Esse é o resultado que justifica o nível de 128 GB, voltaremos a isso mais adiante.
58 e 37 tok/s nos modelos densos
Gemma 4 12B e Qwen 3.8 27B em GGUF: desempenho confortável, mas sem surpresas. São as mesmas ordens de grandeza observadas em um M4 Max, pois a largura de banda mudou pouco entre as duas gerações.
i
Por que o modelo 27B denso é mais lento que o 120B MoE
O Qwen 3.8 27B precisa mover 17 GB de pesos por token gerado. O gpt-oss 120B move cerca de 3 GB, correspondentes aos pesos dos especialistas ativados, embora os 65 GB precisem caber na memória. A 614 GB/s, o primeiro fica mecanicamente limitado a cerca de 36 tokens por segundo, e é exatamente isso que Joël mede. O segundo tem margem.

#MLX contra GGUF, nas mesmas condições

Comparação de duas barras: Qwen 3.8 27B a 36,6 tokens por segundo em GGUF e 68 tokens por segundo em MLX, ou seja, um aumento de 86 por cento
Mesmo modelo, mesmo tamanho com uma diferença de até um gigabyte; apenas o motor muda. A diferença medida é de 86 %.

Todo mundo afirma que o MLX, a biblioteca da Apple otimizada para Apple Silicon, é mais rápido que o llama.cpp. Pouquíssimas pessoas medem isso em condições rigorosamente iguais, com o mesmo modelo, no mesmo dia e na mesma máquina. É isso que a série B faz: Qwen 3.8 27B em GGUF Q4 a 36,6 tokens por segundo, depois Qwen 3.8 27B em MLX a 68,0 tokens por segundo. Um aumento de 86%.

Nosso guia sobre MLX e o Mac M5 anunciava um ganho de 30 a 40% na geração. No M5 Max e neste modelo, a realidade é mais do dobro. Parte dessa diferença provavelmente vem das otimizações do MLX próprias da geração M5 e dos aceleradores neurais integrados à GPU; ainda não conseguimos isolar sua contribuição. O que podemos dizer é que, em um Mac recente, rodar um modelo denso em GGUF enquanto existe sua versão MLX equivale a deixar metade da máquina na garagem.

Mudar um modelo para o motor MLX
ollama pull qwen3.8:27b-mlx
ollama run qwen3.8:27b-mlx --verbose
→
O hábito a adotar
Antes de baixar um modelo, verifique se existe uma tag -mlx na biblioteca Ollama. Para um modelo denso de 20 GB ou mais, a diferença é evidente. O guia sobre MLX e llama.cpp explica como o motor é escolhido e o que fazer quando falta uma tag MLX.

#O que 128 GB realmente permitem

Esquema: à esquerda, a memória unificada, um mesmo espaço de 128 GB compartilhado entre CPU e GPU no qual o modelo de IA de 65 GB cabe; à direita, a memória dedicada, na qual 65 GB não cabem em 16 GB de VRAM
Diagrama conceitual. A memória unificada disponibiliza todo o conjunto de 128 GB para a GPU. Em um notebook, uma placa de vídeo de 16 GB não consegue carregar um modelo de 65 GB, independentemente da RAM do sistema.

O que realmente importa na faixa de 128 GB não é a velocidade, mas o que cabe na memória. gpt-oss 120B ocupa 65 GB em MXFP4. Nenhum notebook PC consegue executá-lo na GPU: as placas gráficas para notebooks têm um limite de 16 ou 24 GB de VRAM. No M5 Max com 128 GB, ele é carregado, responde entre 75 e 79 tokens por segundo em três execuções e ainda sobra espaço.

Barra empilhada de 128 GB: 35 GB para macOS e aplicações abertas, 65 GB para gpt-oss 120B, 28 GB livres
Distribuição da memória durante a série C, em ordens de grandeza. Joël não fechou nada: Obsidian, Terminal e o restante da sua sessão estavam abertos.

O levantamento de memória feito antes da campanha é revelador: 35 GB ocupados pelo macOS e pelos aplicativos da sessão de trabalho, 93 GB disponíveis para a IA. O modelo de 120B cabe nessa memória com uma margem de cerca de trinta gigabytes, suficiente para manter um contexto longo e um segundo modelo leve em paralelo, como um 8B para autocompletar código. Em um M5 Max de 64 GB, o mesmo modelo não carrega de jeito nenhum; com 96 GB, ele cabe, mas sem margem para o restante.

8,5 a 22,7 segundos
Duração total da resposta do gpt-oss 120B ao prompt de 300 palavras, em três execuções: 669, 732 e depois 1.707 tokens gerados. A velocidade não muda (79,1, 77,5 e 75,5 tokens por segundo); é o comprimento do raciocínio que varia de uma execução para outra, pois o modelo decide se conta ou não suas palavras uma a uma.
50 segundos
Duração da série D: leitura de um documento de 16.689 tokens e, em seguida, redação de uma síntese de 2.584 tokens em dez itens.
Pressão térmica « Nominal »
Medição feita após cada série. Nenhum ventilador audível durante toda a campanha de testes, incluindo o modelo de 120B.
i
O que não conseguimos medir nesse nível
Um modelo denso de 70B em Q4, a configuração que a nossa ficha do MacBook Pro M5 Max estima entre 15 e 25 tokens por segundo em MLX, não estava instalado na máquina. O número continua uma estimativa até a próxima campanha.

#O prefill, o número que ninguém publica

Linha do tempo de uma requisição de 50 segundos: 12 segundos de leitura de um documento de 16.689 tokens a 1.388 tokens por segundo, seguidos de 38 segundos de resposta
Série D. O documento enviado é o relatório de benchmark em si, exportado em texto, seguido de uma instrução de síntese.

Um prompt de vinte palavras não diz nada sobre o prefill. Para medi-lo, Joël enviou ao gpt-oss 120B um texto de 11.280 palavras em um único bloco, ou seja, 16.689 tokens e cerca de 45 páginas, com uma instrução de resumo. Resultado: 1.388 tokens por segundo na leitura, ou seja, doze segundos antes que a primeira palavra da resposta aparecesse, seguidos de 2.584 tokens de síntese a 67,6 tokens por segundo.

Esse é o número que faz sentido para usos sérios. Analisar um contrato, resumir um relatório de auditoria, consultar uma base documental com RAG: em todos esses casos, o modelo passa a maior parte do tempo lendo, não escrevendo. Doze segundos para 45 páginas, em um notebook, sem que um único byte saia da máquina, é o que torna a IA local utilizável para um consultor sujeito ao sigilo profissional ou uma empresa sujeita a exigências de confidencialidade.

→
Ordem de grandeza para seus documentos
A uma taxa de 1.388 tokens por segundo, um contrato de 30 páginas é lido em 8 segundos, um relatório de 100 páginas em 27 segundos. Esses tempos se somam à geração da resposta; portanto, preveja cerca de um minuto para uma síntese completa de um documento longo nessa máquina.

#Calor e ventoinhas

Joël registrou o estado térmico após cada série usando o comando de pressão térmica do macOS. O resultado foi sempre “Nominal”, sem ruído audível das ventoinhas, inclusive durante a série D, que utiliza a GPU em plena carga durante cinquenta segundos. Isso é coerente com o que observamos nos M4 Max, com uma ressalva: nossas medições são feitas em períodos curtos de menos de um minuto. O teste de throttling previsto no protocolo, dez minutos de carga contínua seguidos de uma nova medição da série A, não foi realizado. Vamos solicitá-lo na próxima campanha.

Verificar a pressão térmica durante uma geração
sudo powermetrics --samplers thermal -i 1000 -n 1 | grep -i pressure

#O que essas medições não dizem

Um benchmark honesto lista o que não prova. Aqui estão as ressalvas, na ordem de importância.

Pré-preenchimentos de prompts curtos
Duas execuções por modelo, com a segunda mantida. Mas prompts de 43 a 98 tokens medem apenas a latência de inicialização: somente a série D, com 16.689 tokens, fornece uma taxa real de leitura.
Nenhum modelo denso de 70 bilhões
O nível de 128 GB também se justifica com os 70B em Q4 com contexto longo. Não medido aqui.
Sem teste de throttling
Picos de carga de menos de um minuto. O comportamento durante uma hora de RAG intensivo ainda precisa ser documentado.
Sem medições com alimentação pela bateria
O protocolo exige que o computador esteja conectado à tomada. Na bateria, espere números significativamente inferiores, pois o macOS limita o chip.
Um documento da série D específico de cada testador
O texto longo enviado na série D não é definido pelo protocolo: dois testadores não leem o mesmo documento, o que limita a comparação do prefill entre máquinas. Por sugestão de Joël, o protocolo agora fornece um único texto de referência de 11.292 palavras, disponível para download na seção seguinte: as próximas medições serão comparáveis entre si. A medição desta página foi feita antes, com outro documento de tamanho equivalente.
Uma única máquina, um único operador
Nenhuma variância medida. Se você tiver a mesma configuração, suas medições são bem-vindas; veja a seção seguinte.
Modelos em modo de raciocínio
Os modelos que refletem antes de responder geram muito mais tokens do que as 300 palavras solicitadas, e essa extensão varia de uma execução para outra para um mesmo modelo (669 a 1.707 tokens no gpt-oss 120B). Portanto, os tempos totais não são comparáveis; apenas as velocidades são.
Cache de prompt nas novas execuções
Quando o mesmo prompt é executado novamente, o Ollama reutiliza os tokens já lidos (« prompt eval cached »). O prefill de uma nova execução com o mesmo prompt não é, portanto, uma medição; para medir o prefill, é necessário um prompt longo e novo, como na série D.

#Reproduzir o benchmark em sua casa

Notebook visto de cima sobre uma mesa branca, cronômetro mecânico, carregador conectado, caderno e caneta
Ilustração. Computador conectado à tomada, aplicativos fechados, um modelo por vez: três condições sem as quais uma medição não vale nada.

O protocolo foi projetado para ser executado exatamente da mesma forma em qualquer Mac com Apple Silicon, do MacBook Air ao Mac Studio. Se você seguir as mesmas séries com o mesmo prompt, seus resultados serão diretamente comparáveis aos apresentados nesta página.

  1. 01
    Preparar a máquina
    Conecte o computador à tomada, feche o navegador, o Docker e as máquinas virtuais. Anote o modelo do chip, o número de núcleos do GPU e a versão do Ollama.
  2. 02
    Registrar o estado do sistema
    Anote o chip, o número de núcleos da GPU, as versões do macOS e do Ollama, a alimentação elétrica, a memória disponível e os aplicativos abertos. Joël escreveu um script zsh que gera esse relatório com um único comando; ele será incluído no capítulo de benchmarks do kit Mac após verificação, com a autorização de Joël.
  3. 03
    Série A
    Baixe gemma4:12b e qwen3.8:27b, inicie cada um com --verbose, cole o prompt comum, deixe a resposta terminar, saia com /bye. Faça duas rodadas e mantenha a segunda.
  4. 04
    Série B
    Faça o mesmo com qwen3.8:27b-mlx. Compare a linha eval rate com a da série A.
  5. 05
    Série C
    Se você tiver 96 GB ou mais: gpt-oss:120b. Caso contrário, escolha o maior modelo que caiba na sua memória unificada, reservando 10 GB.
  6. 06
    Série D
    Baixe o texto de referência QuelLLM, com 11 292 palavras, o mesmo para todos, e passe-o para ollama run, seguido da instrução « Resuma este texto em 10 itens de lista ». Anote o número de tokens do prompt exibido: ele depende do modelo, não do texto.
Comandos do protocolo
# Série A — les deux repères
ollama pull gemma4:12b && ollama pull qwen3.8:27b
ollama run gemma4:12b --verbose
ollama run qwen3.8:27b --verbose

# Série B — même modèle, moteur MLX
ollama pull qwen3.8:27b-mlx
ollama run qwen3.8:27b-mlx --verbose

# Série C — le palier 128 Go (65 Go à télécharger)
ollama pull gpt-oss:120b
ollama run gpt-oss:120b --verbose

# Série D — préfill sur le texte de référence commun (11 292 mots)
curl -sO https://quelllm.fr/img/protocole/texte-reference-quelllm-v1.txt
ollama run gpt-oss:120b --verbose "$(cat texte-reference-quelllm-v1.txt) Résume ce texte en 10 puces."
→
Envie-nos suas medições
Cole o bloco de estatísticas brutas de cada medição em um e-mail para contact@quelllm.fr, incluindo seu chip, seus núcleos de GPU e sua versão do Ollama. Publicamos os registros verificados com seu nome, ou anonimamente se você preferir. As configurações que mais nos faltam: M5 Max 64 GB, M5 Pro, Mac Studio M5 Ultra.

#Para quem e a que preço

O M5 Max de 128 GB se justifica por um único uso: rodar localmente modelos que não cabem em nenhum outro notebook, com margem para o contexto e um segundo modelo. Com gpt-oss 120B a 79 tokens por segundo e um documento de 45 páginas lido em doze segundos, sem ventilador, é uma estação de trabalho de IA que cabe em uma bolsa.

Leitura dos resultados por perfil de uso
Você éO que esse benchmark informa a vocêNível recomendado
Consultor, advogado ou contador sujeito a sigilo profissionalUm 120B lê e sintetiza seus documentos localmente, a uma velocidade viável para uso, sem enviar nada para foraM5 Max 128 GB
Desenvolvedor que quer um copiloto local sériogpt-oss 20B ou Qwen 3.6 35B-A3B são mais do que suficientes e cabem em 48 GB. Os nossos 113 e 167 tok/s se referem ao chip com 40 núcleos de GPU: a memória é suficiente, a velocidade será inferior em uma variante com menor largura de bandaM5 Max 48 ou 64 GB
Usuário diário de um assistente de redaçãoUm modelo denso de 12B ou um MoE de 20B atende a esse uso; a versão de 128 GB é um luxo. A memória é suficiente, mas a do M5 Pro é mais lenta: espere velocidades inferiores aos nossos 58 e 113 tok/sM5 Pro 48 GB
Equipe que quer um servidor compartilhadoO Mac Studio M5 Max ou Ultra oferece o mesmo motor de processamento com mais memória e um sistema de refrigeração de computador de mesaMac Studio
!
Essas velocidades se referem a esse chip
Todos os números nesta página foram medidos em um M5 Max com 40 núcleos de GPU e 614 GB/s de largura de banda de memória. A geração de um LLM é limitada por essa largura de banda: em um M5 Max com 32 núcleos de GPU ou em um M5 Pro, cuja memória é mais lenta, os mesmos modelos cabem na memória, mas serão mais lentos. A tabela acima diz o que entra, não a velocidade que você obterá em outro nível.

Se suas necessidades se limitam a modelos de 30 bilhões de parâmetros, metade da memória é suficiente e a diferença de preço paga um monitor muito bom. Se suas necessidades começam em modelos de 100 bilhões, não existe alternativa portátil, e este guia fornece os números para justificar essa escolha a quem assina a ordem de compra.

#Créditos e fontes

Consultor trabalhando à noite em um notebook que exibe um terminal, com luminária de mesa e caderno
Ilustração. Uma sessão de trabalho comum, aplicações abertas: é nesse contexto que as medições foram realizadas, na máquina de trabalho do autor.

As medições desta página foram realizadas por Joël Ramat, consultor de cibersegurança e GRC, especialista em ISO 27001, com atuação em consultoria e auditoria potencializadas por IA on-premise, cofundador e presidente da Sywédgia SAS. Ele executou o protocolo QuelLLM em sua própria máquina em 16 de setembro de 2026 e revisou este artigo antes da publicação. Os dados coletados continuam sendo dele, e ele tem liberdade para publicá-los por conta própria.

Método: saídas brutas de ollama run --verbose copiadas após cada medição, sem edição; estado do sistema registrado por script antes da campanha; pressão térmica lida após cada série. O relatório completo, com as respostas integrais dos modelos, é conservado e pode ser fornecido por solicitação. Redação e formatação: Mohamed Meguedmi, QualLLM.


#FAQ

O M5 Max 128 GB é mais rápido que o M4 Max 128 GB em IA local?+
Não de forma espetacular nos modelos densos em GGUF: a largura de banda da memória mudou pouco e o Qwen 3.8 27B roda a 37 tokens por segundo, uma ordem de grandeza comparável à do M4 Max. A diferença aumenta com MLX, em que o M5 Max registra 68 tokens por segundo no mesmo modelo. Não temos uma medição do M4 Max em MLX nas mesmas condições para quantificar a diferença exata.
Por que o gpt-oss 120B é mais rápido que o Qwen 3.8 27B?+
Porque o gpt-oss 120B é um modelo MoE que ativa apenas cerca de 5 bilhões de parâmetros por token, enquanto o Qwen 3.8 27B, denso, movimenta 27 bilhões a cada token. A velocidade depende dos parâmetros ativos, não dos parâmetros totais. Por outro lado, os 65 GB do 120B precisam caber na memória, o que só é possível nas configurações com 96 ou 128 GB.
São necessários 128 GB para rodar o gpt-oss 120B?+
São necessários pelo menos 96 GB de memória unificada para carregá-lo com um contexto razoável. Os 128 GB oferecem margem para um contexto longo, um segundo modelo leve e uma sessão normal de trabalho aberta em paralelo. Joël rodava o 120B com 35 GB já ocupados por seus aplicativos.
Esses números valem quando o computador está funcionando apenas com a bateria?+
Não. O protocolo exige conexão à rede elétrica porque o macOS limita o chip quando o computador está funcionando com bateria. Espere velocidades consideravelmente mais baixas ao usar o computador em deslocamento e, sobretudo, medições não reproduzíveis.
Por que os prefills das séries A, B e C não são publicados?+
Eles foram medidos com prompts de 43 a 98 tokens. Nesse tamanho, o prefill dura menos de um segundo e reflete a latência de inicialização, não a taxa de leitura; o número não diz nada sobre a velocidade com que o modelo lê um documento real. A única medição de prefill aproveitável é a da série D, com 16.689 tokens: 1.388 tokens por segundo.
Posso enviar minhas próprias medições?+
Sim. Siga as séries A a D com o prompt comum, com duas execuções por medição, e envie os blocos brutos de estatísticas para contact@quelllm.fr junto com sua configuração. Publicamos os registros verificados dando crédito a você.
Onde encontrar o script de preparação usado para este benchmark?+
O script zsh escrito por Joël Ramat, que gera um relatório completo do estado do Mac antes da medição, será incluído no capítulo sobre benchmark do kit Mac após ser verificado em outras máquinas, com a autorização do autor e o devido crédito. Enquanto isso, a seção “Reproduzir o benchmark” lista as informações a serem anotadas manualmente.

Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.