IA local para prefeituras e governos locais territoriales
Uma prefeitura lida diariamente com correspondências dos cidadãos, projetos de deliberação, atas e solicitações de registro civil. São dados pessoais, às vezes sensíveis, que a administração local tem a obrigação de proteger. A IA para administrações territoriais, tal como é vendida pelas empresas de software, quase sempre passa por uma nuvem americana, o que gera um problema jurídico e político. Este guia mostra como implantar um LLM com pesos abertos em um servidor da administração local, quais usos fazer dele já na primeira semana e quanto isso realmente custa, desde a secretaria de uma prefeitura de um município com 2.000 habitantes até uma entidade intermunicipal com 200 funcionários.
#Por que usar uma IA local em uma administração territorial
O problema de uma administração local não é ter acesso a uma IA. Os servidores públicos já têm uma: ChatGPT no celular pessoal, Copilot no pacote de aplicativos de escritório, um assistente no serviço de mensagens. O problema é que esses usos ocorrem sem regras definidas, com dados dos habitantes copiados para serviços cuja hospedagem, retenção e reutilização a administração local não controla. O DPO (encarregado da proteção de dados, obrigatório para toda autoridade pública desde 2018) não tem nenhuma visibilidade sobre isso.
Um LLM auto-hospedado inverte a lógica. O modelo roda em uma máquina nas instalações da administração local ou na infraestrutura do seu provedor habitual de hospedagem. Nenhum texto sai da rede. A administração local continua sendo a controladora dos dados, sem um operador adicional com quem firmar contrato, sem transferência para fora da União Europeia, sem cláusula a negociar com um gigante que não negocia. E o custo é um investimento pontual em hardware, não uma assinatura por funcionário que aumenta com o uso.
Isso não é uma solução universal. Um modelo local com entre 8 e 30 bilhões de parâmetros não é tão brilhante quanto os melhores modelos proprietários em tarefas abertas. Mas as tarefas de uma prefeitura raramente são abertas: reformular uma correspondência, estruturar uma deliberação, resumir um relatório de 40 páginas, responder a uma pergunta sobre o regulamento do cemitério. Nessas tarefas bem delimitadas, com um bom prompt e os documentos corretos, um modelo do tamanho de Mistral Small ou Qwen3 14B faz o trabalho.
#Casos de uso que funcionam na prefeitura
Implantar uma IA local no trabalho: RGPD, AI Act, arquitetura multiusuário, custos, nota para a diretoria.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
O melhor jeito de fracassar em um projeto de IA na administração local é prometer um “assistente do cidadão” que responda a tudo no site da cidade. O melhor jeito de ter sucesso é começar pelas tarefas internas repetitivas em que os servidores perdem tempo e em que é fácil detectar erros. Aqui estão as tarefas que funcionam bem com um modelo local.
- Correspondências aos administrados
- Resposta a um pedido de exceção às regras escolares, confirmação de recebimento de uma reclamação, notificação de decisão. O servidor fornece os elementos factuais e a orientação da resposta, o modelo redige em linguagem administrativa, e o servidor revisa e assina. O ganho é medido nas correspondências de baixo risco, que são a maioria.
- Minutas de deliberação
- Transformar um comunicado interno ou um orçamento em um projeto de deliberação estruturado (referências legais, considerandos e dispositivo). O modelo respeita bem a forma se lhe forem fornecidas duas ou três deliberações existentes como modelos. O conteúdo continua sob a responsabilidade da secretaria-geral e do jurista.
- Relatórios e resumos
- Resumir um relatório de uma empresa de estudos técnicos, extrair as decisões de uma ata de comissão, produzir uma síntese de uma consulta pública com 300 contribuições. Um modelo com contexto de 32.000 tokens comporta um documento de cerca de cem páginas.
- Recepção e central telefônica
- Ajudar o funcionário de atendimento a responder com rapidez e precisão: horários do ponto de entrega de resíduos, documentos necessários para uma certidão de nascimento, tarifas das atividades no contraturno escolar. Isso passa por um RAG (retrieval-augmented generation) que se baseia nos documentos oficiais da administração local, e não na memória do modelo.
- Contratações públicas
- Primeira revisão de um CCTP para identificar inconsistências, reformulação de critérios de análise, auxílio na redação do relatório de análise de ofertas. O modelo não toma nenhuma decisão, apenas acelera a leitura.
- Tradução e acessibilidade
- Traduzir um documento de instruções para cidadãos que não falam francês, reescrever uma correspondência em linguagem clara (FALC, fácil de ler e compreender). Os modelos recentes têm bom desempenho em francês e nas principais línguas europeias.
Dois casos devem ser descartados logo de início. O primeiro é qualquer decisão individual automatizada (concessão de assistência social, cálculo de uma tarifa com base no quociente familiar): o Código das Relações entre o Público e a Administração exige informar o usuário sobre o processamento algorítmico e explicar suas regras, e o regulamento europeu sobre IA inclui a avaliação do acesso a benefícios públicos essenciais entre os sistemas de alto risco. O segundo é o agente conversacional público disponibilizado no site da cidade, que exige um nível de maturidade (testes, supervisão, gestão de desvios) que poucas administrações locais têm no primeiro projeto.
#Por que a nuvem americana é um problema para uma administração local
O argumento não é ideológico, é jurídico. Uma autoridade local é controladora de dados nos termos do RGPD. Quando ela utiliza um serviço de IA online, o fornecedor se torna operador de dados, e um contrato em conformidade com o artigo 28 deve regular a relação: finalidades, prazos, segurança, suboperadores e destino dos dados ao término do contrato. Nos grandes serviços voltados ao público em geral, esse contrato é um contrato de adesão que a autoridade local não pode alterar, e as condições frequentemente permitem a retenção das conversas e, dependendo da oferta, seu uso para melhorar o serviço.
- Transferências para fora da UE
- A hospedagem nos Estados Unidos constitui uma transferência para um país terceiro. Atualmente, essa transferência se baseia no marco de proteção de dados UE–Estados Unidos (decisão de adequação de julho de 2023), já contestado perante os tribunais europeus. O precedente Schrems II (invalidação do Privacy Shield em 2020) mostra que essa base pode desaparecer de um dia para o outro, e a administração local deve então justificar seu tratamento de dados de outra forma.
- Cloud Act
- A lei americana de 2018 permite que as autoridades dos Estados Unidos exijam de um fornecedor sujeito à sua legislação a entrega de dados, independentemente de onde eles estejam armazenados. Uma hospedagem em um centro de dados europeu de um fornecedor americano não protege contra essa exigência. É exatamente isso que o referencial SecNumCloud da ANSSI busca excluir.
- Diretriz 'nuvem no centro'
- A circular do primeiro-ministro de 2021, atualizada em 2023, exige que os órgãos da administração do Estado hospedem dados sensíveis em serviços qualificados SecNumCloud e protegidos contra legislações extraterritoriais. Ela não se aplica diretamente às coletividades territoriais, mas define o nível de exigência que um representante eleito ou um DPO pode tomar como referência, e as prefeituras departamentais francesas se inspiram nela em seus diálogos com as coletividades territoriais.
- Análise de impacto
- O processamento de dados dos cidadãos por uma IA generativa, na escala de uma administração local, está entre os casos em que uma análise de impacto relativa à proteção de dados (artigo 35 do RGPD) é fortemente recomendada. Ela é muito mais simples de redigir quando não há transferência nem subcontratante.
- Sigilo e dados sensíveis
- Os serviços sociais (CCAS), a polícia municipal e os serviços de registro civil lidam com dados de saúde, infrações e situações familiares. Essas categorias estão excluídas das condições de uso da maioria dos serviços de IA para o público em geral, e seu envio para um terceiro sem vínculo contratual constitui uma violação de dados que deve ser notificada à CNIL.
Com hospedagem própria, a maioria desses pontos desaparece pela própria concepção da solução. Restam obrigações, e elas são reais: manter o registro das operações de tratamento atualizado com essa nova ferramenta, definir os prazos de retenção das conversas, informar os servidores e estabelecer diretrizes de uso em uma política. Mas são obrigações que a administração local já sabe cumprir para seus outros softwares.
#Pré-requisitos e governança
Antes de comprar equipamentos, três decisões a tomar em reunião, não diante de um terminal.
- Quem está por trás do projeto
- Uma dupla: um responsável pela área de negócio (diretor-geral de serviços, secretário-geral) e uma pessoa de referência técnica (responsável por TI, o prestador de serviços de TI do município ou o serviço compartilhado da estrutura intermunicipal). Sem um responsável pela área de negócio, o projeto continua sendo um brinquedo do setor de TI.
- Onde o servidor está rodando
- Na administração territorial, no centro de dados da associação intermunicipal ou do departamento francês, ou em um provedor de hospedagem francês. As três opções são compatíveis com este guia. Para um município pequeno, o serviço de TI compartilhado da comunidade de municípios costuma ser a melhor opção: um servidor, dez prefeituras.
- Quais dados entram
- Decidir antecipadamente quais documentos alimentarão o RAG (regulamentos, deliberações publicadas, procedimentos internos) e o que não será incluído (dossiês individuais do CCAS, dados da polícia municipal). Essa lista é o núcleo da entrada no registro de atividades de tratamento.
- Competências
- Um técnico familiarizado com Linux e Docker basta para a instalação e a operação. O RAG exige um pouco mais de método (preparação dos documentos), mas não mais código.
- Rede
- O servidor deve ser acessível a partir dos computadores dos servidores públicos (rede interna ou VPN) e nunca deve ser exposto diretamente na internet. Um proxy reverso com autenticação é o mínimo se o acesso ultrapassar a rede local.
Quanto à compra, uma máquina com preço inferior a 40.000 € sem impostos se enquadra nas contratações públicas sem publicidade nem concorrência prévia, o que abrange todas as configurações deste guia. Ainda assim, é necessário solicitar orçamentos para comparação e incluir no processo uma justificativa da necessidade. Aliás, a maioria das configurações descritas abaixo pode ser comprada pelo catálogo da UGAP ou com o montador habitual da administração local.
#Dimensionar servidor e orçamento
A questão que determina tudo é o tamanho do modelo que você quer disponibilizar e, portanto, a memória de vídeo (VRAM) disponível. Com a quantização Q4_K_M, a mais comum, um modelo de 7 a 8 bilhões de parâmetros ocupa cerca de 5 GB, um de 14B cerca de 9 GB, um de 24 a 32B entre 15 e 19 GB e um de 70B cerca de 40 GB. É preciso acrescentar a memória do contexto (os documentos que estão sendo lidos), que cresce rapidamente com textos longos. O número de funcionários usando o sistema simultaneamente importa menos do que se imagina: em uma prefeitura, dez funcionários equipados raramente geram mais de duas ou três requisições ao mesmo tempo.
Três níveis cobrem quase todas as administrações locais. As faixas de preço abaixo são estimativas aproximadas, a serem confirmadas por orçamento: variam conforme o fornecedor, a memória, o armazenamento e a garantia.
- Nível 1: município com menos de 5.000 habitantes
- Uma estação de trabalho ou um minisservidor com uma placa de 12 ou 16 GB de VRAM (tipo RTX 4070, RTX 4080 ou equivalente), 32 GB de RAM e SSD de 1 TB. Modelos-alvo: Qwen3 8B ou 14B, Gemma 3 12B. Orçamento indicativo para hardware de 1.500 a 2.500 €, sem impostos. Cinco a dez funcionários, redação e resumo, RAG sobre os regulamentos do município.
- Nível 2: cidade de médio porte ou agrupamento intermunicipal
- Uma estação com uma placa de 24 GB (RTX 4090 ou equivalente profissional), 64 GB de RAM, 2 TB de SSD, ou um Mac Studio com 64 GB de memória unificada. Modelos-alvo: Mistral Small 24B, Qwen3 32B em Q4, gpt-oss 20B. Orçamento indicativo de 3.500 a 6.000 € sem impostos. Vinte a cinquenta servidores públicos, todos os casos de uso deste guia.
- Nível 3: ente territorial de grande porte ou serviço compartilhado em âmbito departamental
- Um servidor para montagem em rack com uma ou duas placas profissionais de 48 GB (ou mais), alimentação redundante, integrado à sala de servidores existente. Modelos-alvo: 70B em Q4, ou vários modelos especializados disponibilizados em paralelo. Orçamento indicativo a partir de 10.000 € sem impostos, frequentemente de 15.000 a 25.000 € sem impostos com suporte do fabricante. Várias centenas de servidores públicos, várias administrações locais integrantes.
A esses valores somam-se os custos de eletricidade (uma estação com uma placa voltada ao consumidor consome entre 300 e 500 W sob carga e muito pouco em repouso), alguns dias de instalação e configuração pelo responsável técnico ou por um prestador de serviços e, sobretudo, o tempo de capacitação dos servidores públicos, que é o verdadeiro custo do projeto. Para comparação, uma assinatura de um assistente de IA proprietário para cinquenta servidores públicos geralmente supera o preço do nível 2 já no primeiro ano e é renovada a cada ano.
#Implantação passo a passo
O procedimento abaixo pressupõe um servidor Linux (Ubuntu ou Debian) com uma placa NVIDIA e os drivers instalados. A stack usa o Ollama para servir os modelos e o Open WebUI como interface, com contas de usuários, histórico e RAG integrado.
- 01Instalar Ollama e torná-lo acessível na redeO script oficial instala o Ollama como serviço systemd. Por padrão, ele escuta apenas na própria máquina (http://localhost:11434). Para que a interface, instalada em um contêiner, consiga se conectar a ele, configura-se o Ollama para escutar em todas as interfaces, garantindo que o firewall do servidor bloqueie o acesso externo à porta 11434.
- 02Baixar um ou dois modelosComece com um modelo de tamanho médio e um modelo pequeno e rápido. O primeiro para redação e síntese, o segundo para tarefas curtas e atendimento. O download envolve vários gigabytes e deve ser planejado para fora do horário de funcionamento se a conexão da prefeitura for limitada.
- 03Instalar Open WebUIO Open WebUI é instalado em um contêiner Docker e se conecta ao Ollama. A primeira conta criada é de administrador. Depois, desative o cadastro livre e crie as contas dos funcionários manualmente ou via diretório (LDAP ou SSO são compatíveis com as configurações de administração).
- 04Alimentar a base de documentosNo espaço de trabalho do Open WebUI, crie uma coleção por tema (normas, deliberações, procedimentos de RH) e carregue os PDFs e documentos Word. Prefira documentos limpos, atualizados, sem páginas digitalizadas como imagens. Em seguida, vincule cada coleção a um modelo personalizado com um prompt de sistema que descreva o papel esperado.
- 05Escrever prompts de sistema por área de atuaçãoUm modelo personalizado « Correspondência administrativa » com as diretrizes de redação da administração local, um « Deliberação » com a estrutura esperada e dois exemplos, um « Atendimento » conectado à coleção de informações práticas. Esses modelos aparecem como ferramentas prontas para uso pelos funcionários, que não precisam saber criar prompts.
- 06Proteger e fazer backupProxy reverso com certificado TLS à frente do Open WebUI, acesso limitado à rede interna ou à VPN, backup diário do volume de dados do Open WebUI (contas, conversas, documentos) e da configuração. Registre a ferramenta no registro das atividades de tratamento, definindo um prazo de retenção das conversas, e configure a exclusão de acordo com esse prazo.
Para não deixar a porta 11434 aberta para toda a rede, restrinja o acesso ao próprio servidor e ao contêiner usando o firewall (ufw ou nftables). O guia do site sobre como proteger um servidor Ollama detalha essa parte, bem como a configuração do proxy reverso. Se a administração local já dispõe de um hipervisor Proxmox, uma máquina virtual com passthrough da placa de vídeo é uma boa forma de integrar esse servidor à infraestrutura existente.
#Acompanhar os servidores públicos sem substituí-los
O medo de ser substituído é a primeira reação em um setor quando se anuncia uma IA. Esse medo é legítimo, e responder a ele com slogans não funciona. O que funciona é dizer com precisão o que a ferramenta faz e não faz, e demonstrar isso no trabalho real dos servidores.
- O modelo propõe, o servidor público decide
- Nenhum documento gerado pelo modelo é enviado sem revisão e assinatura humana. Essa regra consta na política de uso, e o prompt de sistema de cada modelo personalizado a relembra no rodapé da resposta. Ela protege a administração local (responsabilidade) e o servidor público (ele continua sendo o autor).
- Treinar com casos reais
- Duas horas por departamento, trabalhando com as correspondências e os processos da semana, não com exemplos genéricos. O objetivo é que cada servidor saia com três situações em que a ferramenta lhe economiza tempo e duas em que não deve usá-la.
- Explicar as alucinações
- Um modelo local inventa referências jurídicas, artigos de códigos legais e números com a mesma confiança com que dá uma resposta correta. Os servidores devem saber que toda referência legal produzida pelo modelo deve ser verificada no Légifrance e que o RAG reduz esse risco nos documentos da administração local, sem eliminá-lo.
- Tornar o uso visível
- Uma convenção interna: incluir a menção « redigido com a ajuda de um assistente, revisado por [agent] » nos documentos de trabalho, nunca nos atos oficiais. Ela desdramatiza o uso e facilita o controle.
- Envolver os representantes dos funcionários
- A introdução de uma ferramenta de IA afeta a organização do trabalho. Informar o Comitê Social Territorial (CST) antes da implantação evita que ele fique sabendo por rumores e transforme o projeto em um conflito.
- Medir sem vigiar
- Acompanhe o número de usuários ativos e os comentários qualitativos, não a produtividade individual. Os registros de conversa servem para solucionar problemas e garantir a conformidade, não para avaliar os servidores públicos, e a carta de princípios deve deixar isso claro.
Nas administrações locais que procederam dessa forma, a adoção não apresenta problemas: os servidores aderem de bom grado a uma ferramenta que elimina a parte ingrata da elaboração de uma correspondência. O ponto de atenção está em outro lugar: alguns servidores confiam excessivamente no modelo e deixam de reler. A revisão cruzada nas primeiras semanas e lembretes regulares das alucinações constatadas são as melhores medidas de proteção.
#Armadilhas e solução de problemas
- Respostas lentas ou com pausas
- O modelo ultrapassa a VRAM e parte dele roda no processador. Verifique com o ollama ps a distribuição GPU/CPU. Use um modelo menor, uma quantização mais agressiva ou reduza o tamanho de contexto solicitado por Open WebUI.
- O RAG dá respostas que não correspondem à pergunta
- Na maioria das vezes, os documentos estão mal divididos (PDFs escaneados, tabelas, layouts complexos). Converta-os em texto limpo antes de enviá-los, remova as versões obsoletas dos regulamentos e teste cada coleção com dez perguntas cujas respostas você conhece.
- O modelo não conhece o vocabulário territorial
- Ele não sabe o que é um CCAS, uma DETR ou uma DSP no seu contexto. Adicione um glossário da administração local no prompt do sistema ou em uma coleção dedicada.
- Um funcionário colou um dossiê de assistência social em uma conversa
- Isso não é um vazamento para fora da administração local, mas é um tratamento de dados fora do escopo permitido. Exclua a conversa, relembre as regras da política de uso e, se necessário, ajuste as permissões de acesso aos modelos por grupo de usuários no Open WebUI.
- Atualização que quebra tudo
- Fixe as versões: tag da imagem Open WebUI, versão de Ollama, lista exata dos modelos. Teste as atualizações em uma máquina secundária ou em uma máquina virtual antes de tocar no servidor dos agentes.
- O servidor está acessível a partir do exterior da rede
- Verifique regularmente se nenhum redirecionamento de porta ou regra de firewall expõe a porta 11434 ou a porta do Open WebUI no endereço público da prefeitura. Milhares de servidores Ollama abertos são identificados continuamente na internet.
#Para se aprofundar
Este guia apresenta o contexto e a implantação básica. Estes guias do site detalham os componentes que você vai utilizar em seguida:
- Implantar um chatbot de IA para sua equipe na intranet
- Detalhes do proxy reverso Nginx, da autenticação, do monitoramento e do backup das conversas para uma implantação do Open WebUI com vários usuários.
- Proteger seu servidor Ollama
- Verificar a exposição do servidor, adicionar autenticação e TLS e adotar boas práticas de rede. Ler antes de permitir acesso de fora da rede local.
- LLM local e RGPD: conformidade na proteção de dados pessoais
- O quadro legal completo (RGPD, regulamento europeu sobre IA, recomendações da CNIL) para documentar a análise de impacto e a entrada no registro.
- RAG local com Ollama sem programar
- Para entender o que acontece quando você insere documentos em uma coleção e melhorar a qualidade das respostas do atendimento.
- Escolher sua quantização (Q4, Q5, Q8, FP16)
- Para escolher entre um modelo maior em Q4 e um modelo menor em Q8 de acordo com a VRAM do servidor comprado.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.