ARC-AGI 2: testar o raciocínio dos LLM open-source
Le Benchmark ARC-AGI 2 tornou-se em 2025 a referência para medir a generalização e o raciocínio abstrato dos LLM de pesos abertos, muito além dos testes clássicos de múltipla escolha, como o MMLU. Desenvolvido por François Chollet e pela fundação Arc Prize, o Benchmark ARC-AGI 2 submete os modelos a quebra-cabeças visuais inéditos nos quais memorização e força bruta já não bastam. Este artigo analisa o protocolo de avaliação, os modelos open-source mais bem classificados do catálogo QualLLM, seus requisitos de hardware em termos de VRAM e as boas práticas para reproduzir esses testes localmente.
O que é o ARC-AGI 2 e por que ele muda o jogo
ARC-AGI 2 é a segunda iteração do Abstraction and Reasoning Corpus, publicada no âmbito doArc Prize 2025 com uma premiação de um milhão de dólares. O conjunto contém cerca de 1.000 tarefas públicas de treinamento, 400 tarefas de avaliação pública e 100 tarefas privadas de teste final. Cada tarefa é composta por uma grade colorida de entrada e uma grade de saída, acompanhadas de 2 a 5 exemplos. O modelo deve deduzir a regra de transformação e depois aplicá-la a um novo caso.
Diferentemente de MMLU ou HumanEval, o ARC-AGI 2 não recompensa conhecimentos gerais nem a correspondência de padrões sintáticos. Ele se concentra no raciocínio de LLMs propriamente dito: composição de regras, manipulação de objetos, simetria, contagem. De acordo com o artigo seminal de Chollet (arXiv:1911.01547), um ser humano não treinado supera 80 % de sucesso; os melhores LLM open-source atingiam no máximo 5-15 % no início de 2025.
Para entender o lugar desse benchmark no ecossistema, veja nosso guia dos benchmarks LLM 2025.
Protocolo de avaliação: o que o ARC-AGI 2 realmente mede
O protocolo oficial impõe duas restrições que distinguem o ARC-AGI 2 dos benchmarks comuns:
- Nenhuma contaminação de dados : as 100 tarefas privadas nunca são publicadas na internet, o que evita qualquer pré-treinamento com viés.
- Orçamento computacional limitado : cada submissão tem um limite de recursos computacionais para desencorajar o uso dispendioso de força bruta.
A pontuação oficial corresponde ao percentual de tarefas resolvidas com duas tentativas permitidas (pass@2). O formato de entrada recomendado é uma grade ASCII ou JSON com codificação de cor de 0 a 9. O repositório oficial no GitHub arc-prize/ARC-AGI-2 fornece os scripts de avaliação, as estruturas de teste em Python e as baselines de referência.
Três famílias de abordagens dominam as submissões open-source:
- Prompting direto com cadeia de raciocínio estruturada
- Treinamento em tempo de teste (TTT): fine-tuning rápido com 2 a 5 exemplos antes da inferência
- Síntese de programas : geração de código Python que o modelo executa para produzir a grade
O treinamento em tempo de teste dá hoje os melhores resultados, mas consome 2 a 10 vezes mais tokens por tarefa. A abordagem de síntese de programas foi popularizada pela equipe MindsAI em sua submissão de 2024 documentada no blog Arc Prize.
Modelos open-source candidatos: VRAM e licenças
Aqui estão os modelos do catálogo QualLLM mais relevantes para alcançar uma boa pontuação no Benchmark ARC-AGI 2, classificados por perfil de hardware.
Categoria de altíssimo desempenho (≥ 400 GB de VRAM em Q4) :
- DeepSeek V4 Pro 1.6T — 1600B de parâmetros, licença MIT, ~960 GB de VRAM em Q4, contexto de 1.000.000 tokens. Arquitetura MoE adaptada ao raciocínio em múltiplas etapas.
- Kimi K2.6 — 1000B, Modified MIT, ~600 GB Q4. Bons resultados anunciados em tarefas de planejamento.
- Ring-1T — 1000B, MIT, ~600 GB Q4, contexto de 131 072 tokens, projetado para raciocínio prolongado.
- DeepSeek R1 671B — 671B, MIT, ~400 GB Q4. Modelo de raciocínio com chain-of-thought nativo.
- MiMo V2.5 Pro — 1020B, MIT, ~595 GB Q4, contexto 1 M tokens. Útil para prompts de few-shot em grande escala.
Faixa intermediária acessível a estações de trabalho (60-250 GB Q4) :
- Qwen 3 235B-A22B — 235B, Apache 2.0, ~142 GB Q4, contexto 131 072.
- gpt-oss 120B — 117B, Apache 2.0, ~70 GB Q4. Boa relação entre custo e capacidade de raciocínio.
- Nemotron 3 Super 120B — 120B, NVIDIA Open Model License, ~72 GB Q4.
- Llama 4 Scout 109B — 109B, Llama 4 Community, ~65 GB Q4, contexto estendido até 10 M tokens.
- Mistral Small 4 — 119B, Apache 2.0, ~72 GB Q4, contexto 256 000 tokens.
Perfil para o público geral (≤ 50 GB Q4) :
- Qwen3-Coder-Next 80B-A3B — 80B, Apache 2.0, ~48 GB Q4. Adequado para a abordagem de síntese de programas.
- DeepSeek R1 Distill Llama 70B — 70B, ~40 GB Q4. Versão destilada do raciocínio R1.
- Llama 3.3 70B Instruct — 70B, ~40 GB Q4.
Os valores de VRAM Q4 são estimativas com base no GGUF Q4_K_M; em Q8 deve-se considerar ×1,9, em FP16 ×3,8. Esses valores ainda precisam ser confirmados conforme o runtime utilizado (llama.cpp, vLLM, SGLang).
Desempenho esperado e tokens por segundo
Nenhum score oficial público ainda foi consolidado para esses modelos na versão 2 do benchmark — os rankings evoluem todos os meses. Como referência, os feedbacks da comunidade doArc Prize Leaderboard 2025 colocam os modelos de raciocínio explícito (R1, Ring-1T) entre 8 % e 18 % em pass@2 sem TTT, e até 25-35 % com treinamento agressivo em tempo de teste. Esses números ainda precisam ser confirmados para as versões quantizadas Q4.
Quanto à taxa de geração, em uma configuração com 2× RTX 6000 Ada (96 GB de VRAM total) com llama.cpp:
- Llama 3.3 70B Q4 : 18-22 tokens/sec (estimado)
- gpt-oss 120B Q4 : 12-16 tokens/sec (estimado)
- Qwen 3 235B-A22B Q4 : 8-12 tokens/sec com offload parcial para a CPU
Para comparações detalhadas de raciocínio, consulte DeepSeek R1 vs Llama 3.3 et os melhores modelos de raciocínio.
Aplicação prática: reproduzir ARC-AGI 2 localmente
Para avaliar um modelo do catálogo no Benchmark ARC-AGI 2, o fluxo de trabalho típico:
- Clonar o repositório oficial
arc-prize/ARC-AGI-2e instalar as dependências Python. - Carregar o modelo via vLLM ou llama.cpp em modo de servidor compatível com OpenAI. A documentação vLLM abrange modelos MoE como Qwen 3 235B-A22B.
- Codificar cada grade em string ASCII e construir um prompt com exemplos few-shot
- Para o treinamento em tempo de teste, isolar uma LoRA de rank 16-32 treinada com as 2-5 demonstrações de cada tarefa (tempo adicional de 30-90 segundos por tarefa). A biblioteca PEFT do HuggingFace abrange esse caso de uso.
- Avaliar com o script
scoring.pyfornecido, que calcula pass@1 e pass@2.
Modelos com contexto longo como MiMo V2.5 Pro (1 milhão de tokens) ou Llama 4 Maverick 400B (1 M tokens) permitem inserir muitos exemplos sem truncamento, o que ajuda em tarefas com regras compostas.
Para dimensionar seu hardware, o configurador QualLLM calcula a VRAM necessária com base na quantização desejada.
Erros comuns no ARC-AGI 2 e estratégias de abordagem
A análise das submissões malsucedidas no repositório arc-prize/ARC-AGI-2 revela três famílias de bugs recorrentes nos LLMs open-source:
- Alucinação de cor : o modelo inventa uma cor ausente da paleta 0-9. Mitigação: restringir a saída por meio de uma gramática JSON tipada (processador de logits no vLLM).
- Inversão de linhas/colunas : confusão entre dimensões nas grades não quadradas. Mitigação: anotar
H × Lno prompt. - Generalização excessiva : aplicação de uma regra correta nos exemplos, mas que ignora a nuance do caso de teste. Mitigação: forçar uma etapa
<verification>após chain-of-thought.
Para abordagens alternativas, o trabalho da equipe Greenblatt (sample-then-filter com Claude Sonnet, veja arXiv:2406.07394) mostra que um modelo menor com geração massiva (1000+ programas Python sample-and-test) pode superar um modelo maior em single-shot. Essa lógica se aplica bem a Qwen3-Coder-Next 80B-A3B, que se destaca em síntese de código.
Comparação rápida com ARC-AGI 1
O ARC-AGI 1 (2019) já estava saturado no final de 2024 por soluções híbridas com resultados acima de 55%. O ARC-AGI 2 volta a aumentar deliberadamente a dificuldade com quatro mudanças:
- Tarefas compostas combinando 2 a 4 transformações primitivas em vez de apenas uma.
- Grades maiores (até 30×30 contra 15×15 na versão v1).
- Eliminação dos vieses estatísticos que permitiam ataques de força bruta por enumeração.
- Tarefas privadas renovadas para 2025-2026, das quais 50 foram projetadas por especialistas humanos em raciocínio visual.
O resultado: as melhores submissões atingem até ~30% em 2025, enquanto ultrapassavam 60% na v1. Para aprofundar o tema, veja também o guia de LLM: raciocínio vs. matemática e a ficha DeepSeek R1 vs Ring-1T.
FAQ
P: Qual modelo open-source obtém a melhor pontuação no ARC-AGI 2 no final de 2025?
Na data de redação, nenhuma classificação oficial estabelece de forma definitiva o pódio open-source. As submissões da comunidade colocam DeepSeek R1 671B et Ring-1T na liderança graças à sua cadeia de pensamento nativa. Os números exatos ainda precisam ser confirmados, pois a classificação é atualizada mensalmente pela equipe Arc Prize.
P: É necessário um modelo de raciocínio ou um modelo geral?
Os modelos com raciocínio explícito (R1, Ring-1T, gpt-oss 120B) superam sistematicamente os modelos generalistas com número equivalente de parâmetros. No ARC-AGI 2, o custo adicional em tokens de reflexão (frequentemente ×3 a ×10) é amplamente compensado pelo ganho em pass@2. Um Llama 3.3 70B padrão continua limitado diante de um DeepSeek R1 Distill Llama 70B.
P: Qual é a quantidade mínima de VRAM para tentar realizar o benchmark de forma séria?
Com 40 GB de VRAM (RTX 6000 Ada ou A6000), você pode rodar DeepSeek R1 Distill Llama 70B em Q4 e buscar uma pontuação respeitável. Para chegar à fronteira open-source, é necessário buscar 250+ GB de memória combinada (multi-GPU ou offload agressivo para a CPU) para modelos como Qwen 3 235B-A22B.
P: O treinamento em tempo de teste traz um ganho real?
Sem TTT, o raciocínio de LLMs baseia-se apenas na inferência em contexto. Com uma LoRA rápida treinada com demonstrações de cada tarefa, observam-se ganhos de 8 a 15 pontos percentuais. A contrapartida é um custo de computação multiplicado por 5 a 10 e maior complexidade de implementação. Para um primeiro teste, continue com prompting direto.
P: Qual é a licença para uso comercial?
Prefira licenças permissivas. Qwen 3 235B-A22B, gpt-oss 120B, Ring-1T et DeepSeek R1 671B estão sob Apache 2.0 ou MIT, sem restrições de uso comercial. Evite Command R+ 104B com licença CC-BY-NC 4.0 para um produto pago.
P: Onde encontrar os datasets e scripts oficiais?
Tudo está centralizado no repositório GitHub arc-prize/ARC-AGI-2 e no HuggingFace datasets/arc-prize. O formato JSON está documentado e estável desde a primeira iteração de 2019.
Conclusão
Le Benchmark ARC-AGI 2 continuará sendo, em 2026, um dos poucos testes resistentes à contaminação e à memorização, o que o torna uma ferramenta valiosa para quem quer comparar objetivamente o raciocínio dos LLM open-source. Antes de iniciar uma avaliação, dimensione com precisão suas GPUs com o configurador QualLLM ou navegue pelo catálogo completo para identificar o modelo mais adequado ao seu limite de VRAM e à licença desejada.