MMLU-Pro: o benchmark de conhecimento para LLMs locais
Le benchmark MMLU-Pro passou a ser a referência para avaliar a profundidade de conhecimento e a capacidade de raciocínio dos modelos open-weights executados localmente. Publicado em 2024 pelo TIGER-Lab, esse benchmark MMLU-Pro corrige as limitações do MMLU original (saturação, perguntas ambíguas, alternativas de múltipla escolha fáceis demais de adivinhar) introduzindo 12.032 perguntas com 10 opções distribuídas em 14 disciplinas. Este artigo detalha o protocolo, as pontuações observadas nos modelos do catálogo QualLLM, o impacto da quantização nos resultados e o método para reproduzir o benchmark em casa em uma GPU de consumo ou estação de trabalho.
Por que MMLU-Pro substituiu o MMLU em avaliações sérias
O MMLU clássico (Hendrycks et al., 2020) apresenta um teto em torno de 88-90% para os melhores modelos, o que torna quase impossível distinguir os modelos de fronteira entre si. O artigo arXiv 2406.01574 introduz três correções principais:
- 10 opções por pergunta ao invés de 4 : a probabilidade de acertar ao acaso passa de 25% para 10%, o que aumenta a amplitude das pontuações.
- Filtragem manual de perguntas ambíguas : cerca de 5.000 perguntas do MMLU original foram eliminadas ou reformuladas por especialistas.
- Adição de perguntas que exigem um alto grau de raciocínio : integração de problemas de STEM (TheoremQA, SciBench) que exigem cálculos em múltiplas etapas em vez da simples recuperação de informações memorizadas.
Resultado: a pontuação média cai de 15 a 25 pontos em relação ao MMLU. Um modelo que obtém 86% no MMLU geralmente cai para cerca de 66% no MMLU-Pro. Essa compressão para baixo volta a dar sentido à medição para comparar modelos modernos com pesos abertos.
O conjunto completo de dados está hospedado em HuggingFace TIGER-Lab/MMLU-Pro e a avaliação de referência é feita via o repositório oficial no GitHub.
Notas MMLU-Pro observadas no catálogo QualLLM
As notas abaixo vêm do leaderboard oficial do TIGER-Lab e de relatórios técnicos dos responsáveis pelos modelos. Os valores marcados como "estimado" provêm de medições comunitárias parciais que precisam ser confirmadas.
- DeepSeek V3 671B : 75,9 % — melhor pontuação registrada entre os modelos generalistas de pesos abertos até o final de 2024. Ficha completa em /modele/deepseek-v3-671b.
- DeepSeek R1 671B : 84,0 % (raciocínio ativado) — ganho de ~8 pontos graças à cadeia de raciocínio interna. Detalhes sobre /modele/deepseek-r1-671b.
- Qwen 3 235B-A22B : 72,1 % estimado — arquitetura MoE, veja /modele/qwen3-235b-a22b.
- Llama 3.1 405B Instruct : 73,3 % — referência Meta, ficha /modele/llama-3-1-405b.
- Llama 3.3 70B Instruct : 68,9 % — melhor relação desempenho/VRAM para estações de trabalho com 40 GB, ficha /modele/llama33-70b.
- Mistral Large 3 675B : 71,5 % estimado — ver /modele/mistral-large-3.
- gpt-oss 120B : 70,2 % estimado — variante destilada da OpenAI, ficha /modele/gpt-oss-120b.
- Qwen 2.5 72B Instruct : 65,4 % — base multilíngue sólida, ficha /modele/qwen25-72b.
- Mixtral 8x22B Instruct : 56,2 % — histórico, mas ainda relevante para comparação, ficha /modele/mixtral-8x22b.
As diferenças entre categorias (direito, medicina, engenharia) podem atingir 20 pontos para o mesmo modelo: uma pontuação média muitas vezes esconde um ponto fraco em uma área do conhecimento.
Impacto da quantização na pontuação dos LLM no MMLU
A quantização reduz a VRAM, mas piora as pontuações. As medições empíricas nos modelos do catálogo indicam estas ordens de grandeza (fontes: issues do llama.cpp, relatórios do Unsloth):
- FP16 → Q8_0 : perda < 0,5 ponto no MMLU-Pro, geralmente não significativa.
- Q8 → Q5_K_M : perda de 1 a 2 pontos conforme a disciplina (matemática mais afetada).
- Q5 → Q4_K_M : perda de 2 a 4 pontos, mais evidente em perguntas de raciocínio em múltiplas etapas.
- Q4 → Q3 : possível queda acentuada (> 5 pontos), evitar em usos exigentes.
Para Llama 3.3 70B Instruct, por exemplo, observa-se uma queda de ~68 % em FP16 para ~64 % em Q4_K_M no subconjunto "law". Em Qwen 2.5 72B Instruct, a diferença é mais contida (1,5 ponto). A regra prática: Q5_K_M continua sendo o melhor equilíbrio para avaliações sérias, Q4 é suficiente para o uso diário.
Ver o Guia de quantização GGUF para os detalhes dos formatos.
VRAM e custo de hardware para rodar o benchmark de conhecimento
Reproduzir MMLU-Pro localmente exige carregar o modelo na memória e gerar aproximadamente 12.032 respostas (com CoT, isso representa 5 a 10 milhões de tokens de saída). Custo em hardware por lote:
- 24 GB VRAM (RTX 4090) : limitado a modelos de ~30B em Q4; sem acesso a grandes modelos open-weights.
- 48 GB de VRAM (2× RTX 4090 ou RTX 6000 Ada) : permite Llama 3.3 70B Instruct em Q4 (~40 GB), Qwen 2.5 72B Instruct (~42 GB), Qwen3-Coder-Next 80B-A3B (~48 GB).
- 96 GB VRAM (2× RTX 6000 Ada) : permite executar Mixtral 8x22B Instruct (~82 GB), gpt-oss 120B (~70 GB), Mistral Small 4 (~72 GB).
- 160-200 GB de VRAM (4-5× RTX 6000 Ada ou H100) : Llama 3.1 405B Instruct em Q4 (~240 GB com offloading para a CPU), Qwen 3 235B-A22B (~142 GB).
- 400+ GB de VRAM (cluster H100/H200) : DeepSeek V3 671B, DeepSeek R1 671B, Kimi K2.5 e mais.
Um benchmark completo em um modelo de 70B em Q4 leva de 4 a 8 horas em RTX 6000 Ada de acordo com o throughput (~25-35 tokens/seg). Para calibrar seu setup, o utilitário /configurateur recomenda o hardware adequado para uma quantidade-alvo de VRAM.
Método para reproduzir o benchmark localmente
O protocolo padrão utiliza vllm ou llama.cpp no backend, com o script Python oficial do repositório TIGER-AI-Lab.
Etapas principais:
- Download do dataset a partir do HuggingFace (aproximadamente 12 MB).
- Configuração do modelo em modo de conclusão de chat com temperatura 0 e top-p 1. O prompt de sistema deve incluir 5 exemplos few-shot por categoria (CoT ativado).
- Início da avaliação disciplina por disciplina (14 categorias: biology, business, chemistry, computer_science, economics, engineering, health, history, law, math, other, philosophy, physics, psychology).
- Parsing das respostas : extração da última letra (A a J) via regex na última linha.
- Cálculo da pontuação ponderado por categoria ou calculado como média global.
Detalhes completos no README GitHub. Para comparar dois modelos lado a lado, veja /compare/llama33-70b-vs-qwen25-72b ou consultar o ranking geral em /meilleur-llm/raisonnement.
Limites do MMLU-Pro e benchmarks complementares
Nenhum benchmark é suficiente sozinho. O MMLU-Pro mede conhecimentos acadêmicos e raciocínio estruturado, mas não cobre:
- O código : utilizar HumanEval, MBPP ou LiveCodeBench. O modelo Qwen3-Coder-Next 80B-A3B é projetado para essa categoria (fiche).
- Matemática avançada : AIME, MATH, GSM8K permanecem indispensáveis. DeepSeek R1 671B brilha especialmente aqui.
- Multilinguismo : MGSM, Multilingual MMLU, Belebele para o francês. Mistral Large 3 675B e Rakuten AI 3.0 são mais bem avaliados nesses aspectos.
- Contexto longo : RULER, LongBench. Llama 4 Scout 109B (10M de tokens de contexto) ou MiMo V2.5 Pro (1M tokens) são as referências aqui.
- L'agentique : SWE-bench, BFCL, AgentBench.
Um conjunto de testes robusto combina pelo menos MMLU-Pro + HumanEval + GSM8K + um benchmark de agentes.
FAQ
P: Qual a diferença prática entre MMLU e MMLU-Pro?
O MMLU tem 4 opções por pergunta e satura acima de 88%. O MMLU-Pro passa para 10 opções, filtra perguntas ambíguas e incorpora raciocínio em múltiplas etapas. Resultado: as pontuações caem de 15 a 25 pontos, o que restabelece a capacidade de distinguir os modelos. Para uso a partir de 2025, o MMLU-Pro é agora a referência nos relatórios técnicos dos fornecedores.
P: É necessário ativar o chain-of-thought para avaliar um modelo?
Sim, para benchmarks comparativos, pois o protocolo oficial MMLU-Pro o utiliza. Sem CoT, as pontuações caem de 5 a 15 pontos, dependendo do modelo. Em DeepSeek R1 671B, o modo de raciocínio ganha ~8 pontos em relação a uma chamada direta. Para medir a relevância em produção sem CoT, execute a avaliação no modo "answer only" separadamente.
P: Posso rodar o benchmark de conhecimento em um Mac M4?
Sim, via llama.cpp ou MLX. Um Mac Studio M4 Max de 128 GB pode rodar Llama 3.3 70B Instruct em Q4 (~40 GB) a 8-12 tokens/s, ou seja, 6 a 10 horas para o benchmark completo. Modelos acima de 100B exigem um M4 Ultra com 192 GB ou um offloading para SSD muito lento. Veja o guia para Mac Apple Silicon para as configurações recomendadas.
P: A pontuação MMLU-Pro é confiável para escolher um modelo para uso profissional?
Parcialmente. MMLU-Pro reflete bem a capacidade geral, mas uma pontuação global de 70% pode ocultar 55% em direito e 82% em física. Se o seu caso de uso estiver voltado a uma disciplina específica, verifique a pontuação por categoria publicada no leaderboard. Para uso em programação ou na área jurídica em língua francesa, complemente com HumanEval-FR e um teste interno com seus próprios dados.
Q: Qual licença para os modelos mais bem classificados no benchmark?
Os melhores resultados com pesos abertos vêm de modelos sob licenças permissivas: DeepSeek V3 671B (DeepSeek License), DeepSeek R1 671B (MIT), Qwen 3 235B-A22B (Apache 2.0), Mistral Large 3 675B (Apache 2.0). Observação: Llama 3.1 405B Instruct está sob Llama 3.1 Community (restrições acima de 700M MAU). Verifique cada licença antes de um deploy comercial.
P: Quanto custa uma avaliação completa com GPU alugada?
A 2 €/h por uma H100 de 80 GB em uma nuvem bare-metal, um benchmark MMLU-Pro completo em um modelo de 70B em Q4 custa de 8 a 16 €, dependendo da taxa de processamento. Para um modelo de 405B em Q4 que exige 4 H100, conte com 80 a 160 €. Isso é muito mais barato do que comprar o hardware, mas a inferência local continua relevante para avaliações repetidas ou dados sensíveis.
Conclusão
Le benchmark MMLU-Pro oferece hoje a medição mais discriminante de conhecimento e raciocínio para LLMs de pesos abertos. Com benchmarks especializados (HumanEval, AIME, LongBench), permite avaliar de forma objetiva uma escolha de modelo. Para identificar a configuração de hardware que permite rodar os melhores modelos do ranking, acesse o configurador QualLLM ou explore os 249 modelos indexados no catálogo completo.