MMLU-Pro: o benchmark de conhecimento para LLMs locais

Le benchmark MMLU-Pro passou a ser a referência para avaliar a profundidade de conhecimento e a capacidade de raciocínio dos modelos open-weights executados localmente. Publicado em 2024 pelo TIGER-Lab, esse benchmark MMLU-Pro corrige as limitações do MMLU original (saturação, perguntas ambíguas, alternativas de múltipla escolha fáceis demais de adivinhar) introduzindo 12.032 perguntas com 10 opções distribuídas em 14 disciplinas. Este artigo detalha o protocolo, as pontuações observadas nos modelos do catálogo QualLLM, o impacto da quantização nos resultados e o método para reproduzir o benchmark em casa em uma GPU de consumo ou estação de trabalho.

Por que MMLU-Pro substituiu o MMLU em avaliações sérias

O MMLU clássico (Hendrycks et al., 2020) apresenta um teto em torno de 88-90% para os melhores modelos, o que torna quase impossível distinguir os modelos de fronteira entre si. O artigo arXiv 2406.01574 introduz três correções principais:

Resultado: a pontuação média cai de 15 a 25 pontos em relação ao MMLU. Um modelo que obtém 86% no MMLU geralmente cai para cerca de 66% no MMLU-Pro. Essa compressão para baixo volta a dar sentido à medição para comparar modelos modernos com pesos abertos.

O conjunto completo de dados está hospedado em HuggingFace TIGER-Lab/MMLU-Pro e a avaliação de referência é feita via o repositório oficial no GitHub.

Notas MMLU-Pro observadas no catálogo QualLLM

As notas abaixo vêm do leaderboard oficial do TIGER-Lab e de relatórios técnicos dos responsáveis pelos modelos. Os valores marcados como "estimado" provêm de medições comunitárias parciais que precisam ser confirmadas.

As diferenças entre categorias (direito, medicina, engenharia) podem atingir 20 pontos para o mesmo modelo: uma pontuação média muitas vezes esconde um ponto fraco em uma área do conhecimento.

Impacto da quantização na pontuação dos LLM no MMLU

A quantização reduz a VRAM, mas piora as pontuações. As medições empíricas nos modelos do catálogo indicam estas ordens de grandeza (fontes: issues do llama.cpp, relatórios do Unsloth):

Para Llama 3.3 70B Instruct, por exemplo, observa-se uma queda de ~68 % em FP16 para ~64 % em Q4_K_M no subconjunto "law". Em Qwen 2.5 72B Instruct, a diferença é mais contida (1,5 ponto). A regra prática: Q5_K_M continua sendo o melhor equilíbrio para avaliações sérias, Q4 é suficiente para o uso diário.

Ver o Guia de quantização GGUF para os detalhes dos formatos.

VRAM e custo de hardware para rodar o benchmark de conhecimento

Reproduzir MMLU-Pro localmente exige carregar o modelo na memória e gerar aproximadamente 12.032 respostas (com CoT, isso representa 5 a 10 milhões de tokens de saída). Custo em hardware por lote:

Um benchmark completo em um modelo de 70B em Q4 leva de 4 a 8 horas em RTX 6000 Ada de acordo com o throughput (~25-35 tokens/seg). Para calibrar seu setup, o utilitário /configurateur recomenda o hardware adequado para uma quantidade-alvo de VRAM.

Método para reproduzir o benchmark localmente

O protocolo padrão utiliza vllm ou llama.cpp no backend, com o script Python oficial do repositório TIGER-AI-Lab.

Etapas principais:

  1. Download do dataset a partir do HuggingFace (aproximadamente 12 MB).
  2. Configuração do modelo em modo de conclusão de chat com temperatura 0 e top-p 1. O prompt de sistema deve incluir 5 exemplos few-shot por categoria (CoT ativado).
  3. Início da avaliação disciplina por disciplina (14 categorias: biology, business, chemistry, computer_science, economics, engineering, health, history, law, math, other, philosophy, physics, psychology).
  4. Parsing das respostas : extração da última letra (A a J) via regex na última linha.
  5. Cálculo da pontuação ponderado por categoria ou calculado como média global.

Detalhes completos no README GitHub. Para comparar dois modelos lado a lado, veja /compare/llama33-70b-vs-qwen25-72b ou consultar o ranking geral em /meilleur-llm/raisonnement.

Limites do MMLU-Pro e benchmarks complementares

Nenhum benchmark é suficiente sozinho. O MMLU-Pro mede conhecimentos acadêmicos e raciocínio estruturado, mas não cobre:

Um conjunto de testes robusto combina pelo menos MMLU-Pro + HumanEval + GSM8K + um benchmark de agentes.

FAQ

P: Qual a diferença prática entre MMLU e MMLU-Pro?

O MMLU tem 4 opções por pergunta e satura acima de 88%. O MMLU-Pro passa para 10 opções, filtra perguntas ambíguas e incorpora raciocínio em múltiplas etapas. Resultado: as pontuações caem de 15 a 25 pontos, o que restabelece a capacidade de distinguir os modelos. Para uso a partir de 2025, o MMLU-Pro é agora a referência nos relatórios técnicos dos fornecedores.

P: É necessário ativar o chain-of-thought para avaliar um modelo?

Sim, para benchmarks comparativos, pois o protocolo oficial MMLU-Pro o utiliza. Sem CoT, as pontuações caem de 5 a 15 pontos, dependendo do modelo. Em DeepSeek R1 671B, o modo de raciocínio ganha ~8 pontos em relação a uma chamada direta. Para medir a relevância em produção sem CoT, execute a avaliação no modo "answer only" separadamente.

P: Posso rodar o benchmark de conhecimento em um Mac M4?

Sim, via llama.cpp ou MLX. Um Mac Studio M4 Max de 128 GB pode rodar Llama 3.3 70B Instruct em Q4 (~40 GB) a 8-12 tokens/s, ou seja, 6 a 10 horas para o benchmark completo. Modelos acima de 100B exigem um M4 Ultra com 192 GB ou um offloading para SSD muito lento. Veja o guia para Mac Apple Silicon para as configurações recomendadas.

P: A pontuação MMLU-Pro é confiável para escolher um modelo para uso profissional?

Parcialmente. MMLU-Pro reflete bem a capacidade geral, mas uma pontuação global de 70% pode ocultar 55% em direito e 82% em física. Se o seu caso de uso estiver voltado a uma disciplina específica, verifique a pontuação por categoria publicada no leaderboard. Para uso em programação ou na área jurídica em língua francesa, complemente com HumanEval-FR e um teste interno com seus próprios dados.

Q: Qual licença para os modelos mais bem classificados no benchmark?

Os melhores resultados com pesos abertos vêm de modelos sob licenças permissivas: DeepSeek V3 671B (DeepSeek License), DeepSeek R1 671B (MIT), Qwen 3 235B-A22B (Apache 2.0), Mistral Large 3 675B (Apache 2.0). Observação: Llama 3.1 405B Instruct está sob Llama 3.1 Community (restrições acima de 700M MAU). Verifique cada licença antes de um deploy comercial.

P: Quanto custa uma avaliação completa com GPU alugada?

A 2 €/h por uma H100 de 80 GB em uma nuvem bare-metal, um benchmark MMLU-Pro completo em um modelo de 70B em Q4 custa de 8 a 16 €, dependendo da taxa de processamento. Para um modelo de 405B em Q4 que exige 4 H100, conte com 80 a 160 €. Isso é muito mais barato do que comprar o hardware, mas a inferência local continua relevante para avaliações repetidas ou dados sensíveis.

Conclusão

Le benchmark MMLU-Pro oferece hoje a medição mais discriminante de conhecimento e raciocínio para LLMs de pesos abertos. Com benchmarks especializados (HumanEval, AIME, LongBench), permite avaliar de forma objetiva uma escolha de modelo. Para identificar a configuração de hardware que permite rodar os melhores modelos do ranking, acesse o configurador QualLLM ou explore os 249 modelos indexados no catálogo completo.

Artigo publicado em por Mohamed Meguedmi · Fonte de dados: /api/models.json · Licença de conteúdo: CC BY 4.0.

Algum erro ou alguma atualização para informar? Contribuir.