ARC-AGI 2: testar o raciocínio dos LLM open-source

Le Benchmark ARC-AGI 2 tornou-se em 2025 a referência para medir a generalização e o raciocínio abstrato dos LLM de pesos abertos, muito além dos testes clássicos de múltipla escolha, como o MMLU. Desenvolvido por François Chollet e pela fundação Arc Prize, o Benchmark ARC-AGI 2 submete os modelos a quebra-cabeças visuais inéditos nos quais memorização e força bruta já não bastam. Este artigo analisa o protocolo de avaliação, os modelos open-source mais bem classificados do catálogo QualLLM, seus requisitos de hardware em termos de VRAM e as boas práticas para reproduzir esses testes localmente.

O que é o ARC-AGI 2 e por que ele muda o jogo

ARC-AGI 2 é a segunda iteração do Abstraction and Reasoning Corpus, publicada no âmbito doArc Prize 2025 com uma premiação de um milhão de dólares. O conjunto contém cerca de 1.000 tarefas públicas de treinamento, 400 tarefas de avaliação pública e 100 tarefas privadas de teste final. Cada tarefa é composta por uma grade colorida de entrada e uma grade de saída, acompanhadas de 2 a 5 exemplos. O modelo deve deduzir a regra de transformação e depois aplicá-la a um novo caso.

Diferentemente de MMLU ou HumanEval, o ARC-AGI 2 não recompensa conhecimentos gerais nem a correspondência de padrões sintáticos. Ele se concentra no raciocínio de LLMs propriamente dito: composição de regras, manipulação de objetos, simetria, contagem. De acordo com o artigo seminal de Chollet (arXiv:1911.01547), um ser humano não treinado supera 80 % de sucesso; os melhores LLM open-source atingiam no máximo 5-15 % no início de 2025.

Para entender o lugar desse benchmark no ecossistema, veja nosso guia dos benchmarks LLM 2025.

Protocolo de avaliação: o que o ARC-AGI 2 realmente mede

O protocolo oficial impõe duas restrições que distinguem o ARC-AGI 2 dos benchmarks comuns:

A pontuação oficial corresponde ao percentual de tarefas resolvidas com duas tentativas permitidas (pass@2). O formato de entrada recomendado é uma grade ASCII ou JSON com codificação de cor de 0 a 9. O repositório oficial no GitHub arc-prize/ARC-AGI-2 fornece os scripts de avaliação, as estruturas de teste em Python e as baselines de referência.

Três famílias de abordagens dominam as submissões open-source:

O treinamento em tempo de teste dá hoje os melhores resultados, mas consome 2 a 10 vezes mais tokens por tarefa. A abordagem de síntese de programas foi popularizada pela equipe MindsAI em sua submissão de 2024 documentada no blog Arc Prize.

Modelos open-source candidatos: VRAM e licenças

Aqui estão os modelos do catálogo QualLLM mais relevantes para alcançar uma boa pontuação no Benchmark ARC-AGI 2, classificados por perfil de hardware.

Categoria de altíssimo desempenho (≥ 400 GB de VRAM em Q4) :

Faixa intermediária acessível a estações de trabalho (60-250 GB Q4) :

Perfil para o público geral (≤ 50 GB Q4) :

Os valores de VRAM Q4 são estimativas com base no GGUF Q4_K_M; em Q8 deve-se considerar ×1,9, em FP16 ×3,8. Esses valores ainda precisam ser confirmados conforme o runtime utilizado (llama.cpp, vLLM, SGLang).

Desempenho esperado e tokens por segundo

Nenhum score oficial público ainda foi consolidado para esses modelos na versão 2 do benchmark — os rankings evoluem todos os meses. Como referência, os feedbacks da comunidade doArc Prize Leaderboard 2025 colocam os modelos de raciocínio explícito (R1, Ring-1T) entre 8 % e 18 % em pass@2 sem TTT, e até 25-35 % com treinamento agressivo em tempo de teste. Esses números ainda precisam ser confirmados para as versões quantizadas Q4.

Quanto à taxa de geração, em uma configuração com 2× RTX 6000 Ada (96 GB de VRAM total) com llama.cpp:

Para comparações detalhadas de raciocínio, consulte DeepSeek R1 vs Llama 3.3 et os melhores modelos de raciocínio.

Aplicação prática: reproduzir ARC-AGI 2 localmente

Para avaliar um modelo do catálogo no Benchmark ARC-AGI 2, o fluxo de trabalho típico:

  1. Clonar o repositório oficial arc-prize/ARC-AGI-2 e instalar as dependências Python.
  2. Carregar o modelo via vLLM ou llama.cpp em modo de servidor compatível com OpenAI. A documentação vLLM abrange modelos MoE como Qwen 3 235B-A22B.
  3. Codificar cada grade em string ASCII e construir um prompt com exemplos few-shot
  4. Para o treinamento em tempo de teste, isolar uma LoRA de rank 16-32 treinada com as 2-5 demonstrações de cada tarefa (tempo adicional de 30-90 segundos por tarefa). A biblioteca PEFT do HuggingFace abrange esse caso de uso.
  5. Avaliar com o script scoring.py fornecido, que calcula pass@1 e pass@2.

Modelos com contexto longo como MiMo V2.5 Pro (1 milhão de tokens) ou Llama 4 Maverick 400B (1 M tokens) permitem inserir muitos exemplos sem truncamento, o que ajuda em tarefas com regras compostas.

Para dimensionar seu hardware, o configurador QualLLM calcula a VRAM necessária com base na quantização desejada.

Erros comuns no ARC-AGI 2 e estratégias de abordagem

A análise das submissões malsucedidas no repositório arc-prize/ARC-AGI-2 revela três famílias de bugs recorrentes nos LLMs open-source:

Para abordagens alternativas, o trabalho da equipe Greenblatt (sample-then-filter com Claude Sonnet, veja arXiv:2406.07394) mostra que um modelo menor com geração massiva (1000+ programas Python sample-and-test) pode superar um modelo maior em single-shot. Essa lógica se aplica bem a Qwen3-Coder-Next 80B-A3B, que se destaca em síntese de código.

Comparação rápida com ARC-AGI 1

O ARC-AGI 1 (2019) já estava saturado no final de 2024 por soluções híbridas com resultados acima de 55%. O ARC-AGI 2 volta a aumentar deliberadamente a dificuldade com quatro mudanças:

O resultado: as melhores submissões atingem até ~30% em 2025, enquanto ultrapassavam 60% na v1. Para aprofundar o tema, veja também o guia de LLM: raciocínio vs. matemática e a ficha DeepSeek R1 vs Ring-1T.

FAQ

P: Qual modelo open-source obtém a melhor pontuação no ARC-AGI 2 no final de 2025?

Na data de redação, nenhuma classificação oficial estabelece de forma definitiva o pódio open-source. As submissões da comunidade colocam DeepSeek R1 671B et Ring-1T na liderança graças à sua cadeia de pensamento nativa. Os números exatos ainda precisam ser confirmados, pois a classificação é atualizada mensalmente pela equipe Arc Prize.

P: É necessário um modelo de raciocínio ou um modelo geral?

Os modelos com raciocínio explícito (R1, Ring-1T, gpt-oss 120B) superam sistematicamente os modelos generalistas com número equivalente de parâmetros. No ARC-AGI 2, o custo adicional em tokens de reflexão (frequentemente ×3 a ×10) é amplamente compensado pelo ganho em pass@2. Um Llama 3.3 70B padrão continua limitado diante de um DeepSeek R1 Distill Llama 70B.

P: Qual é a quantidade mínima de VRAM para tentar realizar o benchmark de forma séria?

Com 40 GB de VRAM (RTX 6000 Ada ou A6000), você pode rodar DeepSeek R1 Distill Llama 70B em Q4 e buscar uma pontuação respeitável. Para chegar à fronteira open-source, é necessário buscar 250+ GB de memória combinada (multi-GPU ou offload agressivo para a CPU) para modelos como Qwen 3 235B-A22B.

P: O treinamento em tempo de teste traz um ganho real?

Sem TTT, o raciocínio de LLMs baseia-se apenas na inferência em contexto. Com uma LoRA rápida treinada com demonstrações de cada tarefa, observam-se ganhos de 8 a 15 pontos percentuais. A contrapartida é um custo de computação multiplicado por 5 a 10 e maior complexidade de implementação. Para um primeiro teste, continue com prompting direto.

P: Qual é a licença para uso comercial?

Prefira licenças permissivas. Qwen 3 235B-A22B, gpt-oss 120B, Ring-1T et DeepSeek R1 671B estão sob Apache 2.0 ou MIT, sem restrições de uso comercial. Evite Command R+ 104B com licença CC-BY-NC 4.0 para um produto pago.

P: Onde encontrar os datasets e scripts oficiais?

Tudo está centralizado no repositório GitHub arc-prize/ARC-AGI-2 e no HuggingFace datasets/arc-prize. O formato JSON está documentado e estável desde a primeira iteração de 2019.

Conclusão

Le Benchmark ARC-AGI 2 continuará sendo, em 2026, um dos poucos testes resistentes à contaminação e à memorização, o que o torna uma ferramenta valiosa para quem quer comparar objetivamente o raciocínio dos LLM open-source. Antes de iniciar uma avaliação, dimensione com precisão suas GPUs com o configurador QualLLM ou navegue pelo catálogo completo para identificar o modelo mais adequado ao seu limite de VRAM e à licença desejada.

Artigo publicado em por Mohamed Meguedmi · Fonte de dados: /api/models.json · Licença de conteúdo: CC BY 4.0.

Algum erro ou alguma atualização para informar? Contribuir.