IA local em empresas: RGPD, soberania e implantação (2026)
Um servidor de IA local na França é uma máquina com GPU (nas suas instalações ou em um provedor de hospedagem europeu) que executa um modelo de pesos abertos como o Mistral Small e o disponibiliza às suas equipes por uma interface web: os prompts e os documentos permanecem sob seu controle. Para uma PME, um projeto-piloto cabe em uma estação com GPU de 24 GB. Local não significa estar fora do âmbito do RGPD: acesso, registro de logs, registro das atividades de tratamento e segurança continuam sob sua responsabilidade.
Você quer instalar um LLM em uma empresa sem enviar seus dados para um serviço na nuvem. Este guia responde às perguntas na ordem em que surgem: onde colocar o servidor, qual modelo escolher (e sob qual licença), qual hardware usar para quantos usuários, como implantá-lo, protegê-lo e documentá-lo para o DPO. Os preços não aparecem aqui: eles mudam a cada semana.
#Servidor de IA local na França: para que serve, para quem
Um servidor de IA local hospeda um modelo de linguagem em uma infraestrutura que você controla: suas instalações, um rack em um provedor de hospedagem ou um servidor com GPU alugado na Europa. Os colaboradores acessam o modelo por uma interface web ou uma API interna, com suas contas. Para uma PME, a configuração inicial é modesta: uma estação com GPU de 24 GB, Ollama como motor, Open WebUI como interface e um modelo de 24 bilhões de parâmetros como Mistral Small 3.2, que ocupa cerca de 14 GB em Q4 de acordo com o catálogo QuelLLM. Depois, você decide, com um caso de uso real, aumentar a capacidade ou não.
- Privacidade
- Contratos, dossiês de clientes, dados de RH, código-fonte: os prompts e os arquivos não são enviados a um provedor de IA.
- Conformidade simplificada, não eliminada
- Não há subcontratante de IA a citar nem transferência fora da UE a documentar para o modelo em si, mas suas obrigações como responsável pelo tratamento permanecem.
- Custo previsível
- Sem assinatura cujo preço aumente com o número de funcionários: o custo é o do hardware, da eletricidade e do tempo de administração.
- Independência
- Um modelo de pesos abertos, depois de baixado, continua funcionando mesmo se um fornecedor mudar seus preços ou condições.
#RGPD e soberania: o que o local muda e o que não muda
Implantar uma IA local no trabalho: RGPD, AI Act, arquitetura multiusuário, custos, nota para a diretoria.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
A CNIL lembra que o RGPD protege os dados das pessoas em três pontos: nas bases de treinamento, nos modelos que podem tê-los memorizado e no uso dos modelos por meio das instruções (os prompts). Seu servidor local resolve a terceira questão, a dos prompts: eles permanecem com você. Ele não resolve a segunda: um modelo de linguagem pode, ele próprio, conter dados pessoais, o que diz respeito à escolha do modelo e à forma como você o documenta.
Quanto às transferências, a CNIL indica que uma transferência para fora da União Europeia e do Espaço Econômico Europeu só é possível desde que se garanta um nível de proteção suficiente e adequado. Com um servidor nas suas próprias instalações, a questão não se coloca. Com um provedor de hospedagem, ela se coloca conforme sua estrutura e suas filiais.
#LLM privado hospedado na França: as opções concretas
Três arquiteturas permitem hospedar um LLM privado, de acordo com o nível de controle desejado. A tabela compara essas arquiteturas nos aspectos que realmente importam: onde estão os dados, quem administra e o que você deve demonstrar a um auditor.
| Opção | Onde estão os dados | Quem administra | Ponto de atenção |
|---|---|---|---|
| Servidor nas suas instalações (on-premise) | Nas suas instalações, na sua rede interna | Vous | O mais simples de justificar perante um DPO; o investimento inicial e a operação ficam sob sua responsabilidade |
| Servidor GPU alugado em um provedor europeu | No provedor de hospedagem, na região escolhida | O provedor de hospedagem administra o hardware, você administra o software | Verifique a região real, o contrato de subcontratação e a estrutura do provedor de hospedagem |
| Estação de trabalho ou mini-PC robusto | No computador | Vous | Ideal para um piloto; sem redundância, sem alta disponibilidade |
#Hospedado na França, na Europa, SecNumCloud: três coisas diferentes
“Hospedado na França” descreve um local, não uma proteção jurídica. A Scaleway, por exemplo, destaca para suas instâncias GPU a garantia de que os dados permaneçam na Europa e a proteção contra leis extraterritoriais: são compromissos comerciais a serem lidos no contrato, não fatos que este guia pode verificar por você. Para os dados mais sensíveis, a ANSSI oferece a qualificação SecNumCloud, que visa proteger dados e operações de processamento sensíveis contra a ameaça do cibercrime e a aplicação de leis extraterritoriais.
Duas observações úteis antes de se apoiar nessa qualificação. Por um lado, a ANSSI observa que essa qualificação não permite concluir qual é o nível de segurança dos serviços que você implanta na oferta qualificada: você ainda precisa proteger sua aplicação. Por outro lado, ela qualifica ofertas específicas de nuvem, não um provedor de hospedagem como um todo: consulte o catálogo de produtos e serviços qualificados para verificar se a oferta de GPU que você pretende usar está incluída.
#Qual modelo para uma empresa francesa e sob que licença
A escolha é feita com base em três critérios: a qualidade em francês, a memória necessária e a licença. A licença é o critério que se esquece: um modelo muito bom pode ser proibido para uso comercial. O catálogo QuelLLM exibe a licença de cada modelo; aqui estão alguns pontos de referência para modelos franceses ou europeus.
| Modelo | Tamanho | Memória em Q4 | Licença | Observação |
|---|---|---|---|---|
| Mistral Nemo 12B Instruct | 12B | 7 GB | Apache 2.0 | Contexto de 128.000 tokens; boa opção para começar com uma placa de vídeo de menor capacidade |
| Mistral Small 3.2 24B | 24B | 14 GB | Apache 2.0 | Multilíngue, visão; equilíbrio entre qualidade e custo para uma PME |
| EuroLLM 22B Instruct | 22,6B | 13 GB | Apache 2.0 | Modelo europeu; contexto de 32 768 tokens |
| Mistral Small 4 | 119B (MoE) | 72 GB | Apache 2.0 | Reservado para um servidor com muita memória |
| Codestral 22B v0.1 | 22B | 13 GB | Mistral Non-Production License | Não é para uso comercial: verifique antes de qualquer implantação |
O modelo de 32 bilhões de parâmetros frequentemente citado como “bom equilíbrio” ocupa 19 a 20 GB em Q4, considerando apenas os pesos: em uma placa de 24 GB, sobra muito pouco para o contexto e para vários usuários ao mesmo tempo. Para uma primeira implantação, um modelo de 24 bilhões de parâmetros é uma base mais realista. Teste o francês em seus próprios documentos antes de decidir: a qualidade apresentada em um ranking não prevê a qualidade no jargão da sua área profissional.
#Orçamento e equipamento: dimensionar por usuários simultâneos
O bom dimensionamento não depende do número de funcionários, mas do número de pessoas que enviam uma solicitação ao mesmo tempo. De acordo com a FAQ de Ollama, um modelo trata por padrão uma solicitação de cada vez; as demais aguardam em fila, e a memória necessária cresce como o produto do número de solicitações paralelas pela extensão do contexto. Permitir quatro solicitações paralelas em um contexto de 8.000 tokens, por exemplo, reserva então a quantidade equivalente a 32.000 tokens de memória de contexto.
| Situação | O que buscar | Opção de software |
|---|---|---|
| Piloto para 1 a 5 pessoas, uso pontual | Estação com GPU de 24 GB ou Mac com muita memória unificada; modelo de 12 a 24B | Ollama e Open WebUI |
| Equipe de algumas dezenas de pessoas, uso diário | Servidor GPU dedicado com mais memória; medir a latência com usuários reais | Ollama com paralelismo ajustado, ou um servidor de alta vazão como o vLLM |
| Várias unidades, disponibilidade exigida | Dois servidores, um gateway, supervisão | LiteLLM ou equivalente como camada à frente de vários motores |
Essas linhas são referências de arquitetura, não medidas: a latência percebida depende do modelo, da quantização, do contexto e do perfil de uso. Faça um piloto de duas a quatro semanas com um caso de uso específico, observe as filas e a ocupação de memória, depois dimensione.
#Chatbot interno e RAG documental
O uso mais rentável é o chatbot conectado à sua base de documentos: o RAG, em que o assistente responde com base nos seus procedimentos, contratos ou na sua documentação técnica, recuperados sob demanda. Open WebUI, AnythingLLM e PrivateGPT oferecem esse funcionamento pronto para uso. Atenção à licença da interface: o Open WebUI proíbe remover sua marca quando há mais de cinquenta usuários em uma janela móvel de trinta dias, salvo com autorização ou licença empresarial, o que afeta diretamente uma implantação empresarial com identidade visual própria.
Segundo ponto: o RAG não substitui os direitos de acesso. Se todos os funcionários consultarem a mesma base, um documento reservado à direção deve permanecer inacessível aos outros. Isole as coleções por grupo e teste com uma conta sem direitos.
#Segurança da implantação
O ponto de partida é simples: de acordo com a FAQ do Ollama, ele aceita conexões por padrão em 127.0.0.1, porta 11434. Enquanto você não modificar OLLAMA_HOST, ele só é acessível a partir da própria máquina. O perigo surge quando ele é aberto à rede para que a interface, em outro servidor, possa acessá-lo, sem nenhuma camada de proteção à frente.
- Isolamento de rede
- Servidor em rede interna, acesso apenas por interface; isolamento completo (air-gap) para os dados mais sensíveis.
- Gestão de acesso
- Autenticação, papéis, desativação do cadastro livre, registro das requisições na interface.
- Criptografia
- Criptografe os discos que contêm os modelos, as bases documentais e os históricos de conversa.
- Atualizações
- Acompanhe as versões do motor, da interface e dos modelos; documente quem é responsável.
- Backup e exclusão de dados
- Defina por quanto tempo as conversas serão armazenadas e qual será o procedimento de exclusão quando uma pessoa a solicitar.
#Soluções recomendadas e deploy em sete etapas
- 01Definir um caso de usoEscolha um uso específico (suporte, documentação interna) e a categoria de dados envolvidos antes de escolher o hardware.
- 02Escolher a hospedagemNas instalações, com um provedor de hospedagem europeu ou em uma estação de trabalho, conforme a sensibilidade dos dados e a tabela de opções.
- 03Escolher o modeloVerifique a licença, teste o francês em seus documentos e tenha em mente a quantidade de memória necessária.
- 04Instalar o motor e a interfaceOllama e Open WebUI para um projeto-piloto, um servidor de alto throughput para uma carga maior.
- 05ProtegerContas, papéis, HTTPS por meio de um reverse proxy, porta do motor não exposta, discos criptografados.
- 06DocumentarRegistro das operações de tratamento, informação às pessoas, prazo de retenção, contrato de subcontratação se houver um provedor de hospedagem.
- 07Medir com um pilotoDe duas a quatro semanas de uso real, depois a decisão de ampliar a operação.
O software desta stack é gratuito, mas ela não está em conformidade « por concepção »: é o uso que você faz dela, documentado e controlado, que está em conformidade. Mantenha um registro das suas escolhas; é isso que um auditor exigirá.
- Fonte: CNIL, transferência de dados para fora da UE
- Fonte: ANSSI, qualificação SecNumCloud
- Fonte: Scaleway, instâncias GPU
- Fonte: Perguntas Frequentes do Ollama
A IA local está em conformidade com o RGPD?+
Como instalar um LLM em uma empresa?+
É possível hospedar um LLM privado na França?+
Qual servidor usar para uma IA local em uma empresa?+
Existe um LLM privado francês?+
É necessário expor Ollama na rede da empresa?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.