Benchmark de LLMs locais: MMLU, HumanEval, AIME 2026

Un benchmark de LLM local interpretado sem considerar a metodologia equivale a comparar dois tempos de maratona sem o perfil altimétrico do percurso. Dois modelos anunciados com 88 pontos no MMLU podem divergir em 16 pontos no MMLU-Pro e em 30 pontos no AIME 2026, dependendo da presença de treinamento com chain-of-thought, do formato de quantização, do protocolo de decodificação (cons@64 vs pass@1 strict) e da versão exata do conjunto de dados carregado. Esta página não é um guia de compra: é uma matriz de auditoria das três suítes históricas (MMLU/MMLU-Pro, HumanEval/HumanEval+, AIME 2024/2025/2026), com pontuações publicadas, condições de reprodutibilidade, consumo de VRAM em Q4 medido, taxas de tokens por segundo em configurações reais e um inventário dos vieses que os comunicados dos fornecedores omitem. O objetivo inclui ferramentas: permitir reproduzir um resultado por conta própria com uma seed fixa, e não decidir entre modelos proprietários e modelos de pesos abertos.

Por que os critérios de análise de 2026 invalidam os benchmarks anteriores a 2024

O ecossistema mudou em dois anos. O MMLU com 4 opções já saturava com Llama 3.1 405B a 88,6, e as arquiteturas com ativação de especialistas (DeepSeek V3, Qwen 3, GLM-5.1) agora estão próximos do teto; interpretar uma pontuação MMLU com precisão de meio ponto deixou de ter valor informativo. Três mudanças estruturais reconfiguraram o cenário:

  1. Modelos de raciocínio treinados com RL (DeepSeek R1, Ring-1T, gpt-oss 120B com thinking que pode ser ativado) que tornam AIME e MATH-500 referências importantes para distinguir o desempenho dos modelos. No AIME 2024, a diferença entre Llama 3.1 405B (~23 pass@1) e DeepSeek R1 671B (~79 pass@1) chega a 55 pontos — uma diferença impossível de observar no MMLU.
  2. Contagem de parâmetros totais versus parâmetros ativos. Qwen 3 235B-A22B ativa apenas 22B parâmetros por token, MiniMax-M2.7 segue a mesma lógica MoE. O benchmark deve ser interpretado com base no custo de inferência equivalente (tokens/segundo × VRAM), e não no número total de parâmetros exibidos.
  3. Suítes de testes anticontaminação. O LiveBench renova seus itens a cada mês, o LiveCodeBench registra a data e a hora dos problemas do Codeforces para isolar aqueles posteriores à data de corte do pré-treinamento, e o SimpleBench mede a robustez do senso comum onde o MMLU atinge seu limite. A HuggingFace Open LLM Leaderboard v2 migrou explicitamente para MMLU-Pro, GPQA, MUSR e IFEval por essa razão.

Ler uma pontuação isolada já não informa nada: apenas a matriz {MMLU-Pro, HumanEval+, AIME 2026, SWE-bench Verified, RULER 128k, GPQA Diamond} fornece informações úteis. O guia /guide/matrice-benchmarks-2026 especifica a ponderação recomendada.

Metodologia: o que cada suíte de testes realmente mede

Le MMLU LLM (Massive Multitask Language Understanding, Hendrycks et al. 2021) abrange 57 disciplinas (medicina, direito, ética, matemática elementar) em questões de múltipla escolha com 4 opções, com o protocolo padrão 5-shot. Repositório de referência: GitHub Hendrycks, artigo arXiv:2009.03300. Acima de 85 %, foi substituído por MMLU-Pro (10 opções, raciocínio em múltiplas etapas, 12.032 itens) no HuggingFace TIGER-Lab, com uma queda típica de 15 a 25 pontos em relação ao MMLU clássico. Versão emergente: MMLU-Redux (artigo arXiv:2406.04127) corrige aproximadamente 6,5% dos itens identificados como incorretos ou ambíguos no conjunto original — um ponto raramente destacado que explica por que duas execuções idênticas podem divergir de 1 a 2 pontos conforme a versão carregada. Para os filtros e o procedimento de avaliação, veja /guide/mmlu-pro-protocole-strict.

HumanEval, publicado por OpenAI (arXiv:2107.03374), avalia 164 problemas em Python com assinaturas de funções e testes unitários. A métrica padrão é pass@1 mais pass@10 et pass@100 requerem respectivamente 10 e 100 amostras por problema, multiplicando o custo de avaliação por esses mesmos fatores. Seu sucessor HumanEval+ (evalplus) adiciona cerca de 80 vezes mais casos de teste gerados por mutação; modelos com excesso de treinamento normalmente perdem de 5 a 10 pontos entre as duas versões, o que revela diretamente o grau de sobreajuste aos testes originais. Para aprofundar a avaliação em código real, SWE-bench Verified mede a resolução de issues GitHub autênticas (500 tickets validados manualmente) e LiveCodeBench mantém um fluxo de problemas do Codeforces com registro de data e hora, que podem ser filtrados por data. O procedimento completo de extração no HumanEval+ é abordado em /guide/humaneval-plus-protocole.

AIME 2024 LLM corresponde aos 15 problemas anuais do American Invitational Mathematics Examination (duas sessões, AIME I e II), com respostas inteiras entre 0 e 999. Tornou-se central com os modelos de raciocínio e diferencia claramente arquiteturas com ou sem chain-of-thought treinado por RL. O conjunto de 2024 é referenciado no ficha do modelo DeepSeek R1. AIME 2025 (março de 2025), seguido de AIME 2026 (fevereiro de 2026), servem agora como provas recentes, pois os enunciados de 2024 foram amplamente indexados. Os relatórios técnicos do final de 2025 costumam usar cons@64 (votação por maioria em 64 amostras, temperatura 0.6, top-p 0.95), o que pode inflar a pontuação bruta em 10 a 15 pontos em comparação com um pass@1 estrito a temperatura 0.

Além desses três pilares, a matriz de avaliação de 2026 inclui GPQA Diamond (198 perguntas de nível de doutorado validadas por especialistas), MATH-500 (problemas de olimpíadas), MuSR (raciocínio narrativo em múltiplas etapas), RULER (recuperação de informações em contextos longos de até 1 milhão de tokens), IFEval (seguimento de instruções rigorosas), BFCL v3 (Berkeley Function Calling Leaderboard) para chamadas estruturadas de ferramentas. Relatórios técnicos sérios publicam agora essa matriz completa em vez de um único score MMLU.

Pontuações publicadas: análise comparativa com hardware equivalente

Os números abaixo provêm das fichas técnicas oficiais ou dos relatórios do HuggingFace. Eles ainda precisam ser reproduzidos por meio do lm-evaluation-harness da EleutherAI, único protocolo independente com autoridade na comunidade open-source.

Nível S — modelos de ponta para raciocínio (> 600B parâmetros) :

Nível A — executável em 1 a 4 GPUs de alto desempenho (100B a 400B) :

Nível B — estação de trabalho única (40 a 80 GB de VRAM) :

comparações apertadas disponíveis em /compare/deepseek-r1-distill-llama-70b-vs-llama33-70b et /compare/qwen3-235b-a22b-vs-llama-3-1-405b.

Custo detalhado do hardware: VRAM, quantizações, taxas de processamento medidas

Um score bruto não vale nada sem o custo de inferência associado. Os valores abaixo correspondem ao formato Q4_K_M do llama.cpp. As conversões para Q5_K_M, Q8_0 ou FP16 multiplicam a VRAM aproximadamente por 1,25, 2 e 4. A calculadora quelllm.fr/configurateur filtra por orçamento de GPU.

Modelo VRAM Q4 Configuração alvo Taxa indicativa de geração de tokens em Q4
DeepSeek V4 Pro 1.6T ~960 GB 8×H200 141 GB, pod TPU v5p 15-20 tok/s tensor-parallel
MiMo V2.5 Pro 1020B ~595 GB 8×H100 80 GB tensor-parallel 20-30 tok/s
Mistral Large 3 675B ~405 GB 6×H100 80 GB ou 4×H200 25-35 tok/s
Llama 3.1 405B ~240 GB 4×A100 80 GB ou 3×H100 20-30 tok/s
Qwen 3 235B-A22B ~142 GB 2×H100 ou 1×H200 141 GB 40-60 tok/s (MoE)
Hunyuan Large 2.0 ~245 GB 3×H100 80 GB 25-30 tok/s
gpt-oss 120B ~70 GB 1×H100, Mac Studio M3 Ultra 192 GB 35-50 tok/s
Mistral Small 4 119B ~72 GB 1×H100, A100 80 GB 30-45 tok/s
Llama 3.3 70B ~40 GB RTX A6000 48 GB, 2×RTX 4090 15 a 25 tok/s em 2×4090
DBRX Instruct 132B ~76 GB 1×H100, 2×A100 40 GB 30-40 tok/s

Os números são ordens de grandeza em single-batch; os deploys multi-tenant com vLLM ou SGLang alcançam até 5 vezes mais throughput agregado por meio de batching contínuo e cache de prefixo. No Mac Studio M3 Ultra (banda de memória de 800 GB/s), Llama 3.3 70B em Q4_K_M atinge 8 a 12 tok/s em single-stream, dependendo do comprimento efetivo do contexto. As arquiteturas MoE (Mixtral 8x22B, Qwen 3, DeepSeek V3) se beneficiam especialmente do SGLang graças ao roteamento de especialistas compartilhado em lote. O guia /guide/quantization-q4-q5-q8 detalha os compromissos entre qualidade e consumo de VRAM e /guide/inference-vllm-vs-llamacpp compara os motores em profundidade. Para fazer um benchmark da sua própria configuração, ver /guide/bench-tokens-par-seconde.

Três vieses que distorcem a interpretação dos rankings

  1. Contaminação dos conjuntos de dados. MMLU e HumanEval circulam desde 2021; alguns modelos já viram as perguntas no pré-treinamento, o que artificialmente aumenta as notas. O trabalho LiveCodeBench propõe um acompanhamento temporal dos problemas do HumanEval para isolar aqueles posteriores à data de corte do pré-treinamento. A detecção de contaminação por sobreposição de n-gramas (método arXiv:2311.04850) mostra que até 12 % dos itens do MMLU aparecem literalmente nos corpora da web indexados.
  2. Variância da decodificação. Uma pontuação AIME pass@1 calculada com temperatura 0,6 e 64 amostras (cons@64, voto majoritário) pode diferir em 10 pontos de um pass@1 estrito com temperatura 0. No GSM8K, a diferença de self-consistency chega a 5 a 8 pontos conforme o número de amostras. Sempre verificar temperature, top_p, max_tokens, número de amostras e regra de agregação na ficha do modelo ou no relatório técnico.
  3. Prompts específicos. Os relatórios da DeepSeek, da Qwen e da Mistral costumam usar prompts de sistema otimizados, às vezes com exemplos few-shot selecionados manualmente. Tentar reproduzir os números em zero-shot, sem ajustes, geralmente resulta em 3 a 8 pontos a menos, às vezes mais nos conjuntos de testes de raciocínio. Para AIME, adicionar o prefixo "Let's think step by step" pode alterar a pontuação em 4 a 6 pontos nos modelos que não foram treinados para raciocínio explícito.

Benchmarks orientados para tarefas do usuário — LMArena (anteriormente Chatbot Arena), LiveBench, SWE-bench Verified — oferecem um complemento menos manipulável. SWE-bench continua sendo a referência para avaliar um modelo agêntico em código real: DeepSeek V3.2 et Qwen3-Coder-Next 80B-A3B obtêm nesse benchmark pontuações superiores a 40%, valores a confirmar no leaderboard atualizado. BFCL v3 adiciona a dimensão de chamada estruturada de ferramentas, útil para implantações agênticas.

Reproduzir um benchmark de ponta a ponta: procedimento típico

Para gerar uma pontuação AIME 2026 defensável com, por exemplo, DeepSeek R1 Distill Llama 70B :

  1. Baixar os pesos no HuggingFace (# HuggingFace : deepseek-ai/DeepSeek-R1-Distill-Llama-70B) e depois converter em GGUF Q4_K_M via llama.cpp/convert_hf_to_gguf.py se você pretende usar CPU/Apple, ou manter o formato safetensors para vLLM.
  2. Definir os hiperparâmetros : temperatura 0.6, top-p 0.95, max_tokens 32768 (o modelo deve raciocinar por um longo tempo), seed registrada para reprodutibilidade.
  3. Carregar o conjunto AIME 2026 a partir de um dataset HuggingFace atualizado. Verificar se o editor não incluiu a solução no prompt por engano — erro comum em forks recentes.
  4. Gerar 64 completions por problema para cons@64, e 1 resposta gerada com temperatura 0 para pass@1 estrito.
  5. Extrair a resposta final via regex na tag \boxed{} ou a última sequência de 1 a 3 dígitos. Tratar o caso em que o modelo emite várias tags <thinking> aninhadas.
  6. Comparar com as soluções oficiais AIME (inteiro 0-999), publicar script e seed.

Prever cerca de 6 a 10 horas em 2×H100 para um 70B em cons@64 nos 15 problemas AIME 2026. O guia /guide/reproduire-benchmark-aime detalha as armadilhas na extração de respostas, especialmente o tratamento das tags <thinking> nos modelos de raciocínio e a normalização das frações geradas.

Estudos de caso com dados numéricos: três cenários concretos

Cenário A — laboratório universitário com 4×A100 80 GB para avaliação de raciocínio matemático. Objetivo: produzir uma curva AIME 2024/2025/2026 reprodutível. Boa escolha: DeepSeek R1 Distill Llama 70B em Q8_0 (140 GB, dois GPUs), comparado a Llama 3.3 70B sem raciocínio nas duas GPUs restantes para medir a contribuição exclusiva da cadeia de pensamento. Custo de um ciclo completo cons@64 nos 45 problemas (AIME 2024 + 2025 + 2026): aproximadamente 30 horas de GPU. Veja /compare/deepseek-r1-distill-llama-70b-vs-llama33-70b.

Cenário B — startup com 1×H100 80 GB para benchmarkar um assistente de código. Três candidatos em confronto: Qwen3-Coder-Next 80B-A3B, gpt-oss 120B et Mistral Small 4 119B. Protocolo: HumanEval+ pass@1, MBPP+ pass@1, LiveCodeBench filtrado para problemas posteriores a outubro de 2024, SWE-bench Verified Lite (50 issues). A taxa de processamento MoE do Qwen3-Coder-Next (3B ativos) permite normalmente 3× mais candidatos por hora do que os modelos densos com VRAM comparável, o que reduz o interesse pela quantização agressiva.

Cenário C — equipe de dados com Mac Studio M3 Ultra 192 GB. A largura de banda da memória de 800 GB/s permanece o fator limitante. Llama 3.3 70B Q5_K_M cabe com folga na memória e entrega de 6 a 10 tok/s. Qwen 3 235B-A22B em Q4 cabe por pouco, ocupando 142 GB, com uma taxa de geração de 4-6 tok/s, mas qualidade superior. gpt-oss 120B em Q4 ocupa 70 GB e deixa margem para o cache KV de longo contexto. Veja /guide/llm-mac-studio-m3-ultra.

Cenário D — avaliar uma regressão entre dois checkpoints ajustados por fine-tuning usando benchmarks. Caso típico de uso industrial: um fine-tuning LoRA com 10k exemplos da área de atuação em Llama 3.3 70B. O risco é a regressão catastrófica nas capacidades gerais. Protocolo mínimo: MMLU (5-shot), IFEval, GSM8K, HumanEval+ antes e depois do fine-tuning, com a mesma semente. Uma queda superior a 2 pontos em 2 das 4 suítes de testes indica sobreajuste. Ver /guide/fine-tuning-sans-regression.

Licenças e condições exatas de uso comercial

Le benchmark de LLM local não serve para nada se a licença proíbe a implantação pretendida. Quatro famílias dominam o ecossistema de pesos abertos de 2026:

Para um comparativo detalhado por licença, ver /guide/licences-llm-open-source.

Escolher um modelo com base no perfil de benchmark desejado

FAQ

P: Qual a diferença entre MMLU e MMLU-Pro?

O MMLU tem 4 opções por questão e chega ao limite de cerca de 88–90% com os melhores modelos de pesos abertos, o que reduz sua capacidade de distinguir os modelos. O MMLU-Pro passa para 10 opções, elimina questões ambíguas e acrescenta itens que exigem raciocínio em várias etapas. As pontuações normalmente caem de 15 a 25 pontos, o que restaura essa capacidade de diferenciação. Para comparar modelos modernos como DeepSeek V3.2 ou Qwen 3 235B-A22B, o MMLU-Pro é hoje mais relevante que o MMLU clássico.

P: Como reproduzir uma pontuação HumanEval localmente?

Instalar evalplus, carregar o modelo via vLLM ou llama.cpp, gerar de 1 a 200 completions por problema de acordo com a métrica desejada, depois executar os testes em Python. Prever um dia de GPU para um modelo de 70B em pass@1 nos 164 problemas, mais para pass@100. Uma pontuação com temperatura 0 difere de uma pontuação média calculada sobre várias amostras: sempre documentar os hiperparâmetros e publicar o script para permitir a comparação cruzada.

P: Devo preferir Q4, Q5 ou Q8 para um benchmark confiável?

Q4_K_M perde tipicamente entre 1 e 3 pontos no MMLU em comparação com o FP16, às vezes mais no AIME, onde o raciocínio longo é sensível a erros acumulados. Q5_K_M e Q6_K reduzem a diferença a menos de um ponto. Q8_0 é quase indistinguível do FP16 na maioria dos conjuntos de testes. Para realizar benchmarks de forma honesta, indicar sempre a quantização utilizada. O guia /guide/quantization-q4-q5-q8 detalha as quedas medidas para cada formato.

P: As pontuações no AIME 2024 estão contaminadas?

Os enunciados do AIME 2024 foram publicados em fevereiro de 2024 e indexados pelos crawlers pouco depois. Modelos com data de corte dos dados posterior a meados de 2024 podem, portanto, ter visto as soluções. Por isso, AIME 2025 e AIME 2026 são preferidos nas avaliações recentes, desde que os modelos não tenham sido expostos. Sempre verificar a data de corte do pré-treinamento anunciada pelo desenvolvedor na model card e cruzar essa informação com o LiveBench para confirmar.

P: Qual modelo para um computador com 24 GB de VRAM?

24 GB excluem os modelos 70B+ em Q4 que exigem pelo menos 40 GB. As opções viáveis são modelos de 30B a 40B em Q4, ou modelos de 70B com quantizações agressivas como IQ2_XXS, ao custo de uma perda significativa de qualidade (5 a 10 pontos no MMLU). Para manter uma qualidade aceitável, escolher modelos de 14B a 32B. Ver o configurador em /configurateur para filtragem por VRAM.

P: Por que as pontuações diferem entre o HuggingFace e os relatórios dos fornecedores?

Os fornecedores dos modelos otimizam os prompts, usam decodificações específicas (cons@64, majority voting) e, às vezes, selecionam as melhores execuções com diferentes seeds. Os rankings independentes como HuggingFace Open LLM Leaderboard impõem um protocolo uniforme (zero-shot ou few-shot fixo, prompts padronizados). Um desvio de 3 a 10 pontos entre as duas fontes é esperado. Em produção, o que importa é o protocolo reprodutível, não o valor máximo.

Conclusão

Un benchmark de LLM local lido sem contexto de licença, quantização e protocolo de decodificação induz ao erro. O método robusto consiste em cruzar, no mínimo, MMLU-Pro, HumanEval+, AIME 2025/2026 e um benchmark de agentes como SWE-bench Verified, verificando a VRAM alvo e a licença antes de qualquer compromisso. O escopo aqui é deliberadamente restrito à medição: o que importa nesta página é a capacidade de reproduzir um número publicado, entender sua margem de erro e confirmar que cabe no seu hardware. Para filtrar os modelos indexados de acordo com seu orçamento de GPU e seu caso de uso, inicie o configurador QualLLM ou navegue pelo catálogo completo.

Artigo publicado e atualizado em por Mohamed Meguedmi · Fonte de dados: /api/models.json · Licença de conteúdo: CC BY 4.0.

Algum erro ou alguma atualização para informar? Contribuir.