Melhor LLM on-premise em conformidade com o RGPD para empresas em 2026
Escolher um LLM RGPD on-premise tornou-se um tema central para as diretorias técnicas europeias que desejam industrializar o processamento de documentos sem expor seus dados a um fornecedor de SaaS de fora da Europa. Um LLM em conformidade com o RGPD, executado na infraestrutura da empresa e corretamente implantado, garante que os prompts, as saídas e os eventuais logs nunca saiam do perímetro controlado pela empresa, o que simplifica consideravelmente as avaliações de impacto (AIPD) e as obrigações do artigo 32 do regulamento. Este artigo analisa os modelos de pesos abertos relevantes em 2026, seus requisitos de hardware, suas licenças, seus casos de uso e os pontos de atenção operacionais antes de uma implantação em produção.
Por que usar um LLM on-premise em conformidade com o RGPD em vez de uma API gerenciada
O regulamento (UE) 2016/679 (ver o texto consolidado no EUR-Lex) exige um controle rigoroso das transferências para fora da UE e uma demonstração clara das bases legais do tratamento. Uma API hospedada em um provedor terceirizado introduz sistematicamente um subcontratante adicional, cláusulas contratuais padrão (CCT) a manter e, em alguns casos, exposição a leis extraterritoriais como o CLOUD Act. Por outro lado, uma implantação on-premise (ou em nuvem privada sob controle da empresa) elimina essa cadeia de dependências.
Três outras motivações aparecem com frequência nos relatos de campo:
- Soberania contratual : nenhuma alteração nos termos de uso do fornecedor pode interromper o serviço.
- Domínio do fine-tuning : os corpora internos especializados permanecem no sistema de informação, o que evita riscos de vazamento por embeddings.
- custo marginal previsível : depois que o hardware estiver amortizado, a inferência não dependerá mais do preço por milhão de tokens.
O ecossistema de pesos abertos, listado em hubs como Hugging Face ou via os servidores de inferência vLLM, permite hoje cobrir quase todos os casos de uso profissionais sem dependência externa. Para um panorama mais amplo das arquiteturas, veja também nosso guia de LLM open-source em empresas.
Quais modelos com pesos abertos escolher em 2026
A escolha de um LLM soberano para empresa depende de um equilíbrio entre qualidade bruta, tamanho do contexto, licença e uso de VRAM. A seguir, uma seleção representativa retirada de nosso catálogo completo, classificada por perfil de uso.
Perfil "data center denso" (>200 GB de VRAM Q4)
- DeepSeek V4 Pro 1.6T : 1600 bilhões de parâmetros, licença MIT, contexto de 1.000.000 tokens, VRAM Q4 estimada em ~960 GB. Uso-alvo: RAG documental em larga escala sobre arquivos jurídicos ou regulatórios.
- MiMo V2.5 Pro : 1020B, MIT, contexto 1M, VRAM Q4 ~595 GB. Boa versatilidade multilíngue.
- Mistral Large 3 675B : 675B, Apache 2.0, contexto 256.000, VRAM Q4 ~405 GB. Vantagem francesa: empresa desenvolvedora sediada em Paris, hospedagem inteiramente controlável na UE.
- GLM-5.1 : 744B, MIT, contexto 200 000, VRAM Q4 ~445 GB.
- Llama 4 Maverick 400B : 400B, licença Llama 4 Community (atenção às cláusulas de uso comercial acima de 700M MAU), contexto 1M.
Perfil "cluster intermediário" (60-200 GB VRAM Q4)
- Qwen 3 235B-A22B : 235B em mistura de especialistas (22B ativos), Apache 2.0, contexto 131 072. Excelente relação qualidade/custo de inferência graças ao MoE.
- MiniMax-M2.7 : 229B, Apache 2.0, contexto 205 000.
- Mixtral 8x22B Instruct : 141B (39B ativados), Apache 2.0, contexto 64 000. Referência europeia sólida para workloads RAG.
- Qwen 3.5 122B-A10B : 122B, Apache 2.0, contexto 262.000.
- gpt-oss 120B : 117B, Apache 2.0, contexto 128 000.
- Llama 4 Scout 109B : 109B, licença Llama 4 Community, contexto de 10M tokens (a confirmar na prática em prompts muito longos).
Perfil "servidor com um único GPU" (20-60 GB de VRAM em Q4)
- Llama 3.3 70B Instruct : 70B, licença Llama 3.3 Community, contexto de 128 000. Cabe em duas RTX 6000 Ada ou em uma H100 de 80 GB em Q4.
- Apertus 70B : 70B, Apache 2.0, contexto 65 536. Modelo de origem suíça, interessante para organizações que buscam um fornecedor europeu no sentido amplo.
- Mixtral 8x7B : 47B, Apache 2.0, contexto 32.768. Ainda relevante para cargas de trabalho em lote que não exigem o que há de mais avançado no estado da arte.
- Salamandra 40B Instruct : 40B, Apache 2.0, contexto 8192. Originário do Barcelona Supercomputing Center, treinado em um corpus multilíngue europeu.
- Qwen 3 32B e Qwen 2.5 Coder 32B: 32B, Apache 2.0. Voltados para RAG generalista e assistente interno de código.
Para uma comparação mais detalhada no segmento 70B, ver Llama 3.3 70B vs Mixtral 8x22B.
Uso de VRAM, quantização e taxa de processamento
A estimativa da VRAM depende da quantização escolhida. Em primeira aproximação, para um modelo denso:
- FP16 : ~2 octetos por parâmetro
- Q8 : ~1 byte por parâmetro
- Q5_K_M : ~0,7 octeto por parâmetro (estimado)
- Q4_K_M : ~0,55 a 0,60 byte por parâmetro
Para arquiteturas MoE como Mixtral 8x22B Instruct ou Qwen 3 235B-A22B, a VRAM necessária corresponde ao armazenamento de todos os especialistas, mesmo que apenas alguns sejam ativados por token. É a memória que limita, não o cálculo. O artigo Mixtral 8x7B no arXiv detalha esse mecanismo.
No que diz respeito à taxa de transferência, os valores em tokens por segundo variam bastante conforme o motor de inferência (vLLM, TensorRT-LLM, llama.cpp, SGLang), o comprimento do contexto efetivo e o processamento em lote. Algumas ordens de grandeza observadas (a confirmar com sua carga de trabalho):
- Llama 3.3 70B Q4 em um H100 80 GB com vLLM: ~35 a 50 tokens/s em single-stream, centenas em batch.
- Mixtral 8x7B Q4 em RTX 4090 24 GB com offload parcial: ~20-30 tokens/seg (estimado).
- Qwen 3 30B-A3B Q4 em RTX 6000 Ada 48 GB: ~60-80 tokens/s em single-stream (estimado), favorecido pela arquitetura MoE.
- DeepSeek R1 671B Q4 em um nó com 8×H200: ~15-25 tokens/s em single-stream (a confirmar conforme a versão de inferência).
Para dimensionar com precisão um servidor, o configurador QualLLM cruza informações sobre GPU, RAM e modelos compatíveis.
Licenças: o que realmente muda na produção
Uma IA em conformidade com o RGPD não é suficiente: também é necessária uma licença compatível com seu modelo de negócios. Três famílias dominam:
- Apache 2.0 (Mistral, Qwen, gpt-oss, Mixtral, Snowflake, MiniMax, IBM Granite, BSC Salamandra…): uso comercial livre, redistribuição autorizada, cláusula de proteção de patentes. É a licença mais simples para uma implantação empresarial.
- MIT (DeepSeek V3.2, R1, V4 Pro, GLM-5.1, Ling 2.6, MiMo, Ring-1T, dots.llm1, Seed-OSS): ainda mais permissiva, mas sem cláusula explícita sobre patentes.
- Llama Community (Meta): uso comercial autorizado, exceto acima de 700 milhões de usuários ativos mensais, com cláusulas de uso aceitável. Disponível no site Llama.
- Gemma (Google): comercial, mas com uma política de usos proibidos que deve ser respeitada.
Para organizações que buscam a rastreabilidade máxima, OLMo 3 32B da Allen AI também publica seus conjuntos de treinamento, o que facilita algumas auditorias (ver o blog Allen AI). Na Europa, Mistral Large 3 675B e Apertus 70B são as opções estruturantes. Mais detalhes na nossa página melhor LLM francês.
Benchmarks e casos de uso para um LLM auto-hospedado em uma empresa
As pontuações públicas devem ser tratadas com cautela: as metodologias variam e a contaminação dos conjuntos de dados de teste já está documentada. Alguns pontos de referência tirados das fichas dos modelos no Hugging Face:
- MMLU (conhecimentos gerais 5-shot): os modelos >200B atingem tipicamente 85-89 %. DeepSeek R1 671B, Qwen 3 235B-A22B e Mistral Large 3 675B estão nessa faixa (a confirmar conforme o pipeline de avaliação).
- HumanEval / MBPP (código Python): Qwen 2.5 Coder 32B e Qwen3-Coder-Next 80B-A3B são candidatos sérios para um assistente de código interno.
- AIME 2024/2025 (raciocínio matemático): DeepSeek R1 671B, QwQ 32B e Ring-1T estão posicionados neste segmento "reasoning".
- Long-context (RULER, LongBench) : Llama 4 Scout 109B, Seed-OSS 36B Instruct (524.288 tokens) e MiMo V2.5 Pro se destacam nos contextos ampliados.
Casos de uso típicos para a área de TI:
- RAG com documentos internos : 32-70B são mais do que suficientes. Veja melhor LLM para RAG e nosso guia RAG on-premise.
- Assistente jurídico / de conformidade : preferir um contexto ≥ 128 000 tokens e um modelo multilíngue sólido (Mistral Large 3, Qwen 3 235B).
- Geração de código : Qwen 2.5/3 Coder, Laguna XS.2, DeepSeek R2 32B.
- Multimodal : Qwen 3 VL 235B-A22B, Molmo 72B, LLaVA-OneVision 72B para análise de documentos escaneados.
- Cargas de trabalho leves e edge : Granite 4.0 H-Small 32B-A9B, Gemma 4 31B, Qwen 3 30B-A3B.
Veja também nosso comparativo DeepSeek R1 vs Llama 3.3 70B para decidir entre raciocínio e custo de hardware.
Arquitetura alvo: do POC para a produção
Uma implantação on-premise robusta se organiza em torno de quatro camadas:
- Camada de hardware : GPU NVIDIA (H100/H200/B200, RTX 6000 Ada, L40S) ou alternativas AMD MI300X. Para workloads >400B, um nó 8×H100 80 GB ou 8×H200 141 GB é o mínimo realista.
- Camada de inferência : vLLM ou SGLang para o throughput, TensorRT-LLM para a latência, llama.cpp para servidores sem GPU dedicada. A documentação vLLM cobre a maioria dos modelos citados aqui.
- Camada de orquestração : Kubernetes com o NVIDIA GPU Operator, KEDA para o escalonamento e um gateway como LiteLLM ou Envoy para a unificação das APIs compatíveis com a API da OpenAI.
- Camada de conformidade : registro criptografado dos prompts com retenção curta, mascaramento de informações de identificação pessoal (PII) na entrada (Presidio, recomendações da CNIL sobre IA), registro das atividades de tratamento atualizado, AIPD documentada.
No que diz respeito à observabilidade, ferramentas como Langfuse ou OpenTelemetry permitem rastrear as cadeias RAG sem enviar os logs para um SaaS. Para uma abordagem estruturada, consulte nosso guia de implantação do LLM em produção e a checklist de segurança de LLM.
FAQ
P: Um LLM com pesos abertos baixado do Hugging Face está automaticamente em conformidade com o RGPD?
Não. A licença do modelo e o local de execução são duas questões distintas. Baixar os pesos do Mistral Large 3 ou do DeepSeek R1 e executá-los em um datacenter europeu sob seu controle elimina a transferência de dados dos usuários para fora da UE, mas você continua responsável pelos tratamentos (artigo 24 do RGPD): AIPD, prazos de conservação, direitos das pessoas, segurança dos acessos.
P: Qual quantização escolher para um LLM on-premise em conformidade com o RGPD sem degradar a qualidade?
Para a produção, Q5_K_M ou Q4_K_M oferecem o melhor equilíbrio entre qualidade e VRAM para modelos com mais de 30B de parâmetros, segundo as avaliações comunitárias publicadas no Hugging Face. Em níveis inferiores (Q3, Q2), a perda se torna mensurável nas tarefas de raciocínio. Para usos regulatórios sensíveis, Q8 ou FP16 permanecem recomendados se a VRAM permitir, especialmente nos modelos <70B.
P: É possível fazer fine-tuning com dados pessoais mantendo a conformidade?
Sim, desde que você documente a base legal, a AIPD e a retenção. Os modelos sob licença Apache 2.0 (Mistral, Qwen, gpt-oss, IBM Granite) ou MIT (DeepSeek, GLM) autorizam explicitamente o fine-tuning comercial. LoRA e QLoRA permitem manter os adaptadores separados dos pesos de base, o que facilita a exclusão a pedido de um titular dos dados, se o corpus justificar.
P: Mixtral 8x22B ou Llama 3.3 70B para começar?
Mixtral 8x22B Instruct consome mais VRAM (82 GB Q4 contra 40 GB), mas conta com uma licença Apache 2.0 mais simples de integrar do ponto de vista jurídico do que a Llama Community License. Llama 3.3 70B Instruct permanece muito sólido em francês e em tarefas gerais. Para um primeiro projeto interno, Llama 3.3 70B é muitas vezes mais acessível em termos de hardware; para um produto redistribuível, Mixtral é mais simples do ponto de vista da licença.
P: É necessário um cluster H100 para um LLM auto-hospedado em uma empresa?
Nem sempre. Um servidor com 2×RTX 6000 Ada de 48 GB ou uma H100 de 80 GB é suficiente para executar Llama 3.3 70B ou Qwen 3 32B em Q4 em workloads RAG de equipe. O cluster com múltiplos GPUs se torna necessário a partir de modelos >100B em precisão completa ou >400B quantizados. O configurador QualLLM calcula o hardware mínimo viável.
P: Modelos de origem chinesa (DeepSeek, Qwen, GLM, MiMo) causam problemas com o RGPD?
O RGPD abrange o tratamento de dados, não a origem dos pesos. Um modelo DeepSeek executado localmente não se comunica com um servidor terceiro — é um arquivo de parâmetros. As obrigações a verificar são a licença (MIT para DeepSeek, Apache 2.0 para Qwen) e as possíveis restrições setoriais internas. A revisão de segurança (análise estática dos pesos, sandboxing) continua recomendada, como em qualquer artefato externo.
Conclusão
Adotar um LLM RGPD on-premise em 2026 já não é mais um projeto exploratório: o ecossistema de pesos abertos abrange todos os perfis de carga, de Qwen 3 30B-A3B em uma única GPU a DeepSeek V4 Pro 1.6T em um cluster denso, com licenças Apache 2.0 ou MIT compatíveis com produção. A verdadeira dificuldade passa a ser o dimensionamento do hardware e a industrialização. Para identificar o modelo adequado ao seu hardware e às suas restrições, inicie o configurador ou navegue pelo catálogo completo dos 249 modelos indexados.