Melhor LLM open-source para educação e ensino
Escolher um LLM de código aberto para educação significa equilibrar a qualidade pedagógica do raciocínio, a capacidade de explicar um conceito passo a passo e a economia de recursos de hardware exigida pela implantação em uma instituição de ensino ou no computador do professor. O LLM de código aberto para educação oferece uma vantagem decisiva em relação aos serviços proprietários: controle dos dados dos alunos, ausência de cotas, conformidade com o RGPD mais simples e custo marginal nulo após a instalação. Este artigo compara os modelos abertos mais relevantes para a tutoria, a geração de exercícios, o auxílio nas tarefas escolares, a correção automática e a produção de conteúdos pedagógicos multilíngues, com seus pré-requisitos de VRAM, licenças e casos de uso concretos para passar da dependência do Khanmigo a um tutor local soberano.
Quais critérios para um LLM pedagógico?
Um modelo voltado para o ensino não se escolhe da mesma forma que um modelo para programação. Os critérios prioritários:
- Raciocínio em múltiplas etapas : capacidade de decompor um problema de matemática ou física sem pular etapas lógicas. As pontuações AIME e MATH (publicadas em Papers With Code) são indicadores úteis.
- Conhecimentos gerais (MMLU) : cobertura das disciplinas (história, biologia, economia). Modelos com > 80 % no MMLU são candidatos sérios para o ensino secundário e superior.
- Qualidade do francês : crítica para o público francófono. Os modelos europeus como Mistral Large 3 675B ou Apertus 70B (Swiss AI) têm vantagem nativa, assim como Salamandra 40B Instruct treinado em corpus multilíngues europeus.
- Licença permissiva : Apache 2.0 ou MIT para permitir uma implantação em uma circunscrição educacional sem entraves jurídicos. A licença Llama Community impõe restrições ao número de usuários ativos mensais.
- Janela de contexto : para ingerir um manual ou vários trabalhos de alunos. Llama 4 Scout 109B anuncia 10 milhões de tokens de contexto, Seed-OSS 36B Instruct oferece 524.288 tokens.
- Alucinações controladas : um tutor que inventa uma fórmula é pior que um manual. Priorizar modelos com modo "raciocínio" explícito como DeepSeek R1 671B ou QwQ 32B.
Para uma análise mais ampla dos critérios de seleção, veja o guia geral para escolher um LLM em QualLLM.
Tutoria escolar e nos anos finais do ensino fundamental e no ensino médio: os modelos 30-70B
Para uma estação de trabalho de professor equipada com uma placa de 24 GB (RTX 4090, RTX 5090) ou uma estação com duas GPUs, a classe 30-70B é o ponto ideal. Ela permite um raciocínio satisfatório sem saturar a VRAM.
- Qwen 3 32B (Apache 2.0) : VRAM Q4 ~19 GB, contexto 131 072 tokens. Excelente em matemática e em francês escrito, com suporte nativo à cadeia de pensamento. Perfil detalhado em HuggingFace Qwen.
- Gemma 4 31B (licença Gemma): 18 GB em Q4, 256 000 tokens de contexto. Respostas bem calibradas para um público escolar, tom moderado.
- Llama 3.3 70B Instruct (Llama 3.3 Community): 40 GB em Q4. Referência absoluta para cultura geral, alto desempenho em MMLU. Evitar se a instituição ultrapassar 700 milhões de usuários ativos mensais — um limite raramente atingido em ambientes educacionais.
- DeepSeek R2 32B (MIT): 19 GB em Q4, raciocínio explícito. Bom candidato para auxílio em exercícios de matemática, física e química.
- OLMo 3 32B (Apache 2.0, Allen AI): 19 GB em Q4. Particularidade: modelo totalmente aberto (pesos + dados + receita de treinamento), valioso para uso acadêmico em que a reprodutibilidade importa. Veja o repositório oficial do Allen AI.
- Apertus 70B (Apache 2.0): 40 GB em Q4. Modelo multilíngue europeu, desenvolvido pela Swiss AI com foco em soberania.
Para um comparativo quantitativo, consultar a página Qwen 3 32B vs Llama 3.3 70B.
Frugalidade: modelos de 30 a 40B que podem rodar em uma GPU de consumo
Para uma escola de ensino médio equipada com uma única RTX 4090, ou um centro de documentação e informação (CDI) que compartilha um computador, buscar um uso de VRAM inferior a 24 GB em Q4 continua sendo necessário.
- Qwen 3.6 35B-A3B (Apache 2.0): 21 GB em Q4, arquitetura MoE com 3B de parâmetros ativos. Velocidade de inferência alta porque apenas os especialistas relevantes são ativados em cada token. Ideal para um tutor que responde rapidamente em sala de aula.
- Seed-OSS 36B Instruct (Apache 2.0, ByteDance): 22 GB em Q4, contexto de 524.288 tokens. Permite a análise de um manual completo ou de uma dissertação longa sem divisão.
- Salamandra 40B Instruct (Apache 2.0, Barcelona Supercomputing Center): 24 GB em Q4. Treinado especificamente para línguas europeias, incluindo o francês e o espanhol. Documentado em HuggingFace BSC-LT.
- Yi 1.5 34B Chat (Apache 2.0, 01.AI): 20 GB em Q4. Boa versatilidade, mas contexto limitado a 4.096 tokens — a ser usado apenas em interações curtas.
Tokens/seg estimados em RTX 4090 em Q4: 35-50 tok/s para modelos 32B densos, 80-120 tok/s para os MoE como Qwen 3.6 35B-A3B. Veja o benchmark de velocidade em QualLLM.
Casos de uso: gerar exercícios, corrigir trabalhos de alunos, explicar um conceito
Geração de exercícios diferenciados. Um professor fornece um objetivo pedagógico e três níveis (apoio, padrão, aprofundamento). Mistral Small 4 (Apache 2.0, 119B, 72 GB em Q4) produz enunciados bem formulados em francês e respeita as instruções sobre o nível de dificuldade. Qwen 3.5 122B-A10B (73 GB em Q4) com seus 10B ativos oferece um excelente equilíbrio entre velocidade e qualidade para produção em larga escala.
Correção de trabalhos escolares curtos. A função-grille (enunciado + critérios + cópia do aluno) exige rigor. DeepSeek R1 Distill 32B (MIT, 19 GB em Q4) ou QwQ 32B (Apache 2.0) lidam bem com rubricas de avaliação estruturadas. Manter um professor humano envolvido continua necessário para a atribuição final das notas.
Tutoria conversacional no estilo do Khanmigo. O objetivo é orientar sem dar a resposta. Llama 3.3 70B Instruct e Gemma 4 31B possuem comportamentos alinhados à pedagogia socrática. Para uma alternativa ao Khanmigo completamente local, esses dois modelos combinados com uma RAG documental sobre os programas de ensino oficiais constituem uma base sólida.
Explicações multimodais acessíveis. Para explicar um esquema de ciências da vida e da Terra ou comentar uma figura histórica, mudar para um modelo de visão e linguagem: Qwen 3 VL 235B-A22B (142 GB em Q4) ou LLaVA-OneVision 72B (42 GB em Q4) para estabelecimentos adequadamente equipados.
Soberania, conformidade e hospedagem na instituição
A implantação de uma IA tutora local em uma instituição de ensino levanta três questões concretas:
- Hospedagem : um servidor acadêmico ou municipal, sem fluxo de saída para uma nuvem estrangeira. Os modelos com licenças MIT e Apache 2.0 (DeepSeek R2 32B, Mistral Small 4, OLMo 3 32B) não impõem restrições à redistribuição interna.
- Conformidade com o RGPD : nenhum prompt de aluno é exposto a terceiros. O regulamento europeu (EUR-Lex 2016/679) é mais simples de cumprir com um modelo on-premise.
- Filtragem e segurança : um sistema de moderação prévio (classificador, lista de bloqueio de prompts) continua necessário. Nenhum LLM aberto é intrinsecamente seguro para um público menor de idade sem medidas explícitas de proteção.
Para explorar as implicações de uma arquitetura soberana, ver o guia de implantação on-premise em QualLLM.
FAQ
P: Qual LLM open source escolher com um orçamento para uma única GPU RTX 4090?
Em uma única RTX 4090 (24 GB de VRAM), optar por Qwen 3 32B ou Gemma 4 31B com quantização Q4 (~19 GB) deixa margem para o contexto. Para uma melhor relação entre velocidade e qualidade, Qwen 3.6 35B-A3B com arquitetura MoE fornece respostas mais rápidas graças aos seus 3B de parâmetros ativos.
P: Existe uma verdadeira alternativa local ao Khanmigo?
Sim. Llama 3.3 70B Instruct ou Apertus 70B combinados com uma base documental RAG (manuais, currículos oficiais) e um prompt de sistema pedagógico socrático reproduzem a função de tutoria do Khanmigo, sem transmissão de dados dos alunos a terceiros. Prever ~40 GB de VRAM e uma estação com 2 GPUs de 24 GB.
P: Os modelos europeus são suficientes para o francês escolar?
Mistral Large 3 675B e Mistral Small 4 (Apache 2.0) se destacam em francês e respeitam as convenções tipográficas. Salamandra 40B Instruct (Apache 2.0, BSC) e Apertus 70B (Swiss AI) são treinados em corpora multilíngues europeus com uma grande proporção de francês — relevantes para um uso com soberania tecnológica.
P: Qual licença preferir para depósito em escola?
As licenças Apache 2.0 e MIT são as mais seguras: nenhuma restrição ao uso comercial, nenhum limiar de usuários. A licença Llama Community impõe condições acima de 700 milhões de usuários ativos mensais — raramente restritivas para uma instituição de ensino, mas é preciso validá-las com o departamento jurídico da autoridade educacional regional.
P: É necessário um modelo de "raciocínio" para a tutoria em matemática?
Para os anos finais do ensino fundamental, um modelo generalista como Gemma 4 31B basta. Para o ensino médio com foco em ciências e o ensino superior, passar para DeepSeek R1 Distill 32B, QwQ 32B ou DeepSeek R2 32B que expõem sua cadeia de pensamento. As pontuações AIME publicadas em HuggingFace Open LLM Leaderboard confirmam sua superioridade em problemas em múltiplos passos.
P: Como evitar alucinações no uso pedagógico?
Três medidas que podem ser combinadas: (1) associar o modelo a uma base RAG de manuais e programas de ensino oficiais, (2) exibir sempre a cadeia de raciocínio quando um modelo de raciocínio for usado, (3) definir as orientações do prompt de sistema ("se você não tiver certeza, diga isso explicitamente"). Nenhuma medida isolada elimina os erros.
Conclusão
A escolha de um LLM de código aberto para educação depende do hardware disponível, da língua-alvo e do nível de ensino. Para os anos finais do ensino fundamental e o ensino médio em uma única GPU, Qwen 3 32B, Gemma 4 31B ou Qwen 3.6 35B-A3B são pontos de entrada sólidos; para uma implantação soberana em toda uma instituição, Mistral Small 4, Apertus 70B ou Llama 3.3 70B Instruct oferecem uma qualidade comparável à dos serviços proprietários. Para refinar a escolha de acordo com seu hardware específico, use o configurador QualLLM ou navegue pelo catálogo completo dos 249 modelos.