Melhor LLM open-source para o setor jurídico 2026
Escolher um LLM jurídico de código aberto em 2026 atende a uma exigência profissional específica: manter o controle dos dados dos clientes, respeitar o sigilo profissional e implantar um modelo sob licença permissiva em infraestrutura interna. Este guia compara os modelos de pesos abertos mais relevantes para escritórios de advocacia, departamentos jurídicos e legaltechs de língua francesa, com especificações de hardware, licenças verificáveis e casos de uso adaptados ao direito francês. Você encontrará abaixo uma seleção proveniente do catálogo QualLLM, um panorama das famílias Mistral, DeepSeek, Qwen e Llama, recomendações de VRAM por porte da organização e, por fim, uma FAQ que esclarece as questões de licença, RGPD e confidencialidade.
Por que um LLM open source para o setor jurídico
O setor jurídico lida com dados sensíveis: dossiês de clientes, contratos, documentos processuais, jurisprudência não publicada. Hospedar um modelo em servidores próprios (ou em nuvem soberana) elimina a transmissão de prompts a terceiros e facilita a conformidade com o RGPD assim como com as obrigações doLei Europeia de IA que vem sendo aplicado gradualmente desde 2024.
Três benefícios concretos para uma IA para escritórios de advocacia auto-hospedada:
- Privacidade : nenhum prompt sai do perímetro do escritório de advocacia, o que protege o sigilo profissional garantido pelo artigo 66-5 da lei de 1971.
- Ajuste fino para a área de atuação : adaptação possível com um corpus jurisprudencial interno (acórdãos de tribunais de apelação, doutrina, modelos de peças processuais).
- Custos controlados : sem cobrança por token, o custo se resume à infraestrutura de GPU e à energia.
Modelos sob licença Apache 2.0 ou MIT devem ser preferidos: permitem uso comercial, modificação e redistribuição sem cláusula de compartilhamento obrigatório. As licenças comunitárias (Llama, Gemma) continuam podendo ser utilizadas, mas exigem análise contratual — ver o guia das licenças open-weights.
Modelos recomendados para redação jurídica em francês
A linguagem jurídica em francês continua sendo uma área em que poucos modelos se destacam em zero-shot. Os atores europeus e os grandes modelos multilíngues oferecem os melhores resultados.
Família Mistral — a opção francesa
- Mistral Large 3 675B (Apache 2.0, Mistral AI) — 675B parâmetros, ~405 GB de VRAM em Q4, contexto de 256.000 tokens. Desenvolvido na França, domina a sintaxe jurídica em língua francesa e aceita documentos muito longos (memoriais, alegações, contratos consolidados). Ficha: Mistral Large 3.
- Mistral Small 4 (Apache 2.0) — 119B, ~72 GB de VRAM em Q4, contexto de 256 000. Bom equilíbrio para um escritório de médio porte com 2× A100 80GB ou 4× RTX 6000 Ada. Ficha: Mistral Small 4.
- Mixtral 8x22B Instruct (Apache 2.0) — 141B (39B ativos em MoE), ~82 GB de VRAM em Q4. Solução Mistral jurídico robusta, já comprovada em várias implantações de legaltech. Ficha: Mixtral 8x22B.
- Mixtral 8x7B (Apache 2.0) — 47B, ~26 GB VRAM em Q4. O mais acessível para começar (1× RTX 4090 + offload CPU possível). Ficha: Mixtral 8x7B.
Mistral AI publica seus tokenizers e pesos em HuggingFace, o que simplifica a auditoria interna.
Família Qwen — multilíngue de alto desempenho
A Alibaba publica uma linha Qwen sob a licença Apache 2.0 cujo desempenho multilíngue inclui o francês.
- Qwen 3 235B-A22B (~142 GB de VRAM em Q4, ctx 131 072) — arquitetura MoE com 22B parâmetros ativos, adequada para a síntese de decisões judiciais extensas. Ficha: Qwen 3 235B.
- Qwen 3.5 122B-A10B (~73 GB VRAM Q4, ctx 262.000) — 10B ativos, latência reduzida para redação interativa.
- Qwen 3 32B (~19 GB VRAM Q4) — pode ser executado em uma única RTX 4090 ou A6000. Ficha : Qwen 3 32B.
- Qwen 3 VL 235B-A22B — variante de visão para OCR de documentos digitalizados e leitura de tabelas. Ficha: Qwen 3 VL 235B.
Ver o comparativo Mistral Large 3 vs Qwen 3 235B para decidir entre domínio nativo do francês e versatilidade multilíngue.
Família DeepSeek — raciocínio longo
DeepSeek se destaca no raciocínio estruturado, útil para a análise de fundamentos jurídicos, o enquadramento jurídico e a construção de argumentações.
- DeepSeek V3.2 (MIT, 685B, ~410 GB VRAM Q4, contexto 128 000) — Ficha : DeepSeek V3.2.
- DeepSeek R1 671B (MIT, ~400 GB de VRAM Q4) — modelo de raciocínio publicado com artigo R1 no arXiv. Ficha: DeepSeek R1 671B.
- DeepSeek R1 Distill 32B (~19 GB VRAM Q4) — versão distilada para servidor com GPU única. Ficha: DeepSeek R1 Distill 32B.
- DeepSeek R2 32B (~19 GB VRAM Q4, contexto 128 000) — iteração 2026 com raciocínio melhorado.
Especificações de hardware por tamanho do escritório de advocacia
A VRAM necessária depende da quantização escolhida. Regra aproximada (a confirmar conforme a implementação do llama.cpp ou vLLM) :
- Q4 (4 bits): ~0,60 GB por bilhão de parâmetros
- Q5 : ~0,75 GB / B
- Q8 : ~1,20 GB / B
- FP16 : ~2,00 GB / B
Escritório individual ou de pequeno porte (1 a 5 advogados)
Orçamento GPU de 2.000–6.000 €, 1× RTX 4090 24 GB ou 1× RTX 6000 Ada 48 GB :
- Qwen 3 30B-A3B (~19 GB Q4, 3B ativos no MoE — latência muito baixa) — fiche
- Mixtral 8x7B Q4 (~26 GB, offload parcial)
- Gemma 4 31B (Gemma license, ~18 GB Q4, ctx 256 000) — fiche
- Qwen 3.6 35B-A3B (~21 GB Q4)
Ver melhor LLM para 24 GB de VRAM para a seleção completa.
Escritório médio (10 a 50 advogados)
Servidor com 2× A100 80GB ou 4× L40S 48GB:
- Mistral Small 4 Q4 ~72 GB
- Mixtral 8x22B Q4 ~82 GB
- Qwen 3.5 122B-A10B Q4 ~73 GB
- gpt-oss 120B (Apache 2.0, OpenAI) ~70 GB — fiche
Grande departamento jurídico ou legaltech
Cluster com 8× H100 80GB (640 GB de VRAM agregada) ou 4× MI300X 192 GB:
- Mistral Large 3 675B Q4 ~405 GB
- DeepSeek V3.2 ~410 GB Q4
- Llama 4 Maverick 400B (~240 GB Q4, ctx 1 000 000) — fiche
Para arquiteturas multi-GPU e paralelismo tensorial, consultar o guia de inferência distribuída e a documentação vLLM.
Benchmarks relevantes para o direito
Nenhum benchmark público avalia especificamente o direito francês, mas vários indicadores indiretos podem ser utilizados:
- MMLU (subcategorias
professional_lawetinternational_law) — abrange principalmente o direito americano, mas atua como indicador. Referencial: artigo MMLU. - LegalBench (projeto HuggingFace) — 162 tarefas jurídicas em inglês.
- MMLU-Pro — versão mais exigente, útil para a qualificação jurídica em cadeia de raciocínio.
Nessas avaliações (números públicos a confirmar conforme as versões):
- Mistral Large 3 : MMLU estimado ~86 %
- DeepSeek V3.2 : MMLU ~88 %, MMLU-Pro ~75 %
- Qwen 3 235B-A22B : MMLU ~87 %
- Llama 3.3 70B Instruct : MMLU ~82 %, contexto 128 000 — fiche
Para comparar código e raciocínio (útil para automatizar legal-ops e análise de cláusulas), veja melhor LLM para programação et melhor LLM de raciocínio.
Casos de uso concretos em escritório de advocacia
- Síntese de peças processuais : Mistral Large 3 ou Qwen 3.5 122B-A10B, contexto ≥ 200.000 tokens que permite ingerir um dossiê completo.
- Redação de um primeiro rascunho (alegações processuais, correspondências, pareceres jurídicos): Mistral Small 4 ou Mixtral 8x22B, suficientes para produzir um rascunho revisado pelo advogado.
- Pesquisa jurisprudencial assistida por RAG : pipeline Qwen 3 32B + base vetorial Légifrance/Doctrine, que pode ser implantado em um único servidor.
- Análise de contratos e detecção de cláusulas : DeepSeek R2 32B ou QwQ 32B para a decomposição lógica dos compromissos — ficha QwQ 32B.
- Anonimização automática de decisões : Granite 4.0 H-Small 32B-A9B (Apache 2.0, IBM, ~19 GB Q4) — fiche.
- OCR e leitura de documentos digitalizados : Qwen 3 VL 235B-A22B para multimodalidade de documentos.
Um projeto europeu soberano merece destaque: Apertus 70B (Swiss AI, Apache 2.0, ~40 GB Q4) — fiche — treinado com atenção especial à conformidade europeia e às línguas oficiais suíças, incluindo o francês.
Desempenho de inferência (tokens/segundo)
Estimativas para configurações comuns (a confirmar conforme o ambiente de execução e o tamanho do lote):
- Mixtral 8x7B Q4 em RTX 4090 via llama.cpp: ~40-60 tok/s em single-stream
- Qwen 3 32B Q4 em RTX 6000 Ada via vLLM: ~35-50 tok/s
- Mistral Small 4 Q4 em 2× A100 80GB via vLLM: ~25-40 tok/s
- Mistral Large 3 Q4 em 8× H100 80GB: ~15-30 tok/s, com uma taxa de processamento muito maior em lotes
Ver os métodos de medição do coletivo llama.cpp para protocolos de benchmark reprodutíveis.
FAQ
P: Qual licença escolher para uma implantação comercial em um escritório de advocacia?
Preferir Apache 2.0 (Mistral, Qwen, Mixtral, gpt-oss, Apertus) ou MIT (DeepSeek). Essas licenças autorizam explicitamente o uso comercial, a modificação e a redistribuição sem cláusula de compartilhamento obrigatório. As licenças comunitárias Llama e Gemma são utilizáveis, mas impõem limites de usuários (Llama) ou restrições de uso (Gemma) que devem ser revisados com o departamento jurídico antes do deploy.
P: Um LLM de código aberto hospedado internamente está em conformidade com o RGPD?
A auto-hospedagem elimina a transferência de dados a terceiros, o que já resolve uma parte importante dos riscos. A conformidade final depende, no entanto, da análise de impacto (AIPD), do registro das atividades de tratamento e dos prazos de retenção dos prompts e das respostas. A implantação auto-hospedada facilita a conformidade, mas não basta para garanti-la — uma auditoria por um DPO continua sendo necessária.
P: Quanta VRAM é necessária para o Mistral Large 3?
Em quantização Q4, Mistral Large 3 675B exige aproximadamente 405 GB de VRAM agregada, ou seja, 6× H100 80GB ou 3× MI300X 192GB. Em Q8 (mais preciso), prever ~810 GB. Para uma qualidade quase equivalente com menor consumo de memória, Mixtral 8x22B (~82 GB Q4) ou Mistral Small 4 (~72 GB Q4) representam opções razoáveis.
P: Qual modelo para o direito francês com uma única GPU de 24 GB?
Com 24 GB de VRAM (RTX 4090, RTX 3090), os melhores candidatos são Qwen 3 30B-A3B (~19 GB Q4, baixa latência devido ao MoE), Mixtral 8x7B Q4 (~26 GB com offload leve), Gemma 4 31B (~18 GB Q4) ou DeepSeek R2 32B (~19 GB Q4). Veja a seleção detalhada em melhor LLM para 24 GB de VRAM.
P: É possível fazer o ajuste fino de um modelo com sua própria jurisprudência?
Sim, via LoRA ou QLoRA em modelos com licença Apache 2.0 ou MIT. Conte com 24 a 80 GB de VRAM conforme o tamanho do modelo base e o rank LoRA escolhido. Modelos MoE (Mixtral, Qwen MoE) exigem cuidados específicos com o roteamento. Consulte o guia de fine-tuning jurídico para boas práticas com corpora anotados.
P: É melhor optar por um modelo denso ou MoE em um escritório de advocacia?
Um modelo dense (Llama 3.3 70B, Qwen 3 32B) oferece qualidade homogênea e integração RAG simples. Um modelo MoE (Mixtral 8x22B, Qwen 3 235B-A22B) oferece um melhor custo-benefício em termos de inferência, pois apenas os especialistas ativos consomem processamento, mas exige mais VRAM total para carregar todos os especialistas. Para uso interativo (ajuda na redação), o MoE é vantajoso; para processamento em lote (análise massiva), o denso continua competitivo.
Conclusão
A escolha de um LLM jurídico de código aberto em 2026 depende de três eixos: licença permissiva (Apache 2.0 ou MIT têm prioridade), qualidade em francês (Mistral à frente, seguido de Qwen e DeepSeek) e orçamento realista para GPU (da RTX 4090 ao cluster H100). Para refinar sua seleção conforme a VRAM disponível e seu caso de uso específico, inicie o configurador QualLLM ou navegue pelo catálogo completo dos 249 modelos indexados.