Intermediário 12 minSetor público

IA local para prefeituras e governos locais territoriales

Uma prefeitura lida diariamente com correspondências dos cidadãos, projetos de deliberação, atas e solicitações de registro civil. São dados pessoais, às vezes sensíveis, que a administração local tem a obrigação de proteger. A IA para administrações territoriais, tal como é vendida pelas empresas de software, quase sempre passa por uma nuvem americana, o que gera um problema jurídico e político. Este guia mostra como implantar um LLM com pesos abertos em um servidor da administração local, quais usos fazer dele já na primeira semana e quanto isso realmente custa, desde a secretaria de uma prefeitura de um município com 2.000 habitantes até uma entidade intermunicipal com 200 funcionários.

Por Marie L.·Atualização 2026-09-28·Testado no Windows, macOS e Linux

#Por que usar uma IA local em uma administração territorial

O problema de uma administração local não é ter acesso a uma IA. Os servidores públicos já têm uma: ChatGPT no celular pessoal, Copilot no pacote de aplicativos de escritório, um assistente no serviço de mensagens. O problema é que esses usos ocorrem sem regras definidas, com dados dos habitantes copiados para serviços cuja hospedagem, retenção e reutilização a administração local não controla. O DPO (encarregado da proteção de dados, obrigatório para toda autoridade pública desde 2018) não tem nenhuma visibilidade sobre isso.

Um LLM auto-hospedado inverte a lógica. O modelo roda em uma máquina nas instalações da administração local ou na infraestrutura do seu provedor habitual de hospedagem. Nenhum texto sai da rede. A administração local continua sendo a controladora dos dados, sem um operador adicional com quem firmar contrato, sem transferência para fora da União Europeia, sem cláusula a negociar com um gigante que não negocia. E o custo é um investimento pontual em hardware, não uma assinatura por funcionário que aumenta com o uso.

Isso não é uma solução universal. Um modelo local com entre 8 e 30 bilhões de parâmetros não é tão brilhante quanto os melhores modelos proprietários em tarefas abertas. Mas as tarefas de uma prefeitura raramente são abertas: reformular uma correspondência, estruturar uma deliberação, resumir um relatório de 40 páginas, responder a uma pergunta sobre o regulamento do cemitério. Nessas tarefas bem delimitadas, com um bom prompt e os documentos corretos, um modelo do tamanho de Mistral Small ou Qwen3 14B faz o trabalho.

i
Do que estamos falando exatamente
Auto-hospedado não significa improvisado. A stack descrita aqui (Ollama para servir o modelo, Open WebUI para a interface multiusuário) é a mesma utilizada em pequenas e médias empresas e em escritórios profissionais que lidam com dados sensíveis. Ela roda em Linux, permite fazer backups como qualquer outro servidor e pode ser administrada com as competências de um técnico de informática da administração pública local.

#Casos de uso que funcionam na prefeitura

O kit IA Local na Empresa

Implantar uma IA local no trabalho: RGPD, AI Act, arquitetura multiusuário, custos, nota para a diretoria.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

O melhor jeito de fracassar em um projeto de IA na administração local é prometer um “assistente do cidadão” que responda a tudo no site da cidade. O melhor jeito de ter sucesso é começar pelas tarefas internas repetitivas em que os servidores perdem tempo e em que é fácil detectar erros. Aqui estão as tarefas que funcionam bem com um modelo local.

Correspondências aos administrados
Resposta a um pedido de exceção às regras escolares, confirmação de recebimento de uma reclamação, notificação de decisão. O servidor fornece os elementos factuais e a orientação da resposta, o modelo redige em linguagem administrativa, e o servidor revisa e assina. O ganho é medido nas correspondências de baixo risco, que são a maioria.
Minutas de deliberação
Transformar um comunicado interno ou um orçamento em um projeto de deliberação estruturado (referências legais, considerandos e dispositivo). O modelo respeita bem a forma se lhe forem fornecidas duas ou três deliberações existentes como modelos. O conteúdo continua sob a responsabilidade da secretaria-geral e do jurista.
Relatórios e resumos
Resumir um relatório de uma empresa de estudos técnicos, extrair as decisões de uma ata de comissão, produzir uma síntese de uma consulta pública com 300 contribuições. Um modelo com contexto de 32.000 tokens comporta um documento de cerca de cem páginas.
Recepção e central telefônica
Ajudar o funcionário de atendimento a responder com rapidez e precisão: horários do ponto de entrega de resíduos, documentos necessários para uma certidão de nascimento, tarifas das atividades no contraturno escolar. Isso passa por um RAG (retrieval-augmented generation) que se baseia nos documentos oficiais da administração local, e não na memória do modelo.
Contratações públicas
Primeira revisão de um CCTP para identificar inconsistências, reformulação de critérios de análise, auxílio na redação do relatório de análise de ofertas. O modelo não toma nenhuma decisão, apenas acelera a leitura.
Tradução e acessibilidade
Traduzir um documento de instruções para cidadãos que não falam francês, reescrever uma correspondência em linguagem clara (FALC, fácil de ler e compreender). Os modelos recentes têm bom desempenho em francês e nas principais línguas europeias.

Dois casos devem ser descartados logo de início. O primeiro é qualquer decisão individual automatizada (concessão de assistência social, cálculo de uma tarifa com base no quociente familiar): o Código das Relações entre o Público e a Administração exige informar o usuário sobre o processamento algorítmico e explicar suas regras, e o regulamento europeu sobre IA inclui a avaliação do acesso a benefícios públicos essenciais entre os sistemas de alto risco. O segundo é o agente conversacional público disponibilizado no site da cidade, que exige um nível de maturidade (testes, supervisão, gestão de desvios) que poucas administrações locais têm no primeiro projeto.

→
Começar por um setor, não pela administração local inteira
Escolha um departamento disposto a participar, com um chefe que impulsione a iniciativa: urbanismo, secretaria geral, recursos humanos. Três a cinco servidores, um caso de uso, seis semanas. Você terá retornos concretos, um primeiro balanço quantificado em horas economizadas e embaixadores internos antes de ampliar a iniciativa.

#Por que a nuvem americana é um problema para uma administração local

O argumento não é ideológico, é jurídico. Uma autoridade local é controladora de dados nos termos do RGPD. Quando ela utiliza um serviço de IA online, o fornecedor se torna operador de dados, e um contrato em conformidade com o artigo 28 deve regular a relação: finalidades, prazos, segurança, suboperadores e destino dos dados ao término do contrato. Nos grandes serviços voltados ao público em geral, esse contrato é um contrato de adesão que a autoridade local não pode alterar, e as condições frequentemente permitem a retenção das conversas e, dependendo da oferta, seu uso para melhorar o serviço.

Transferências para fora da UE
A hospedagem nos Estados Unidos constitui uma transferência para um país terceiro. Atualmente, essa transferência se baseia no marco de proteção de dados UE–Estados Unidos (decisão de adequação de julho de 2023), já contestado perante os tribunais europeus. O precedente Schrems II (invalidação do Privacy Shield em 2020) mostra que essa base pode desaparecer de um dia para o outro, e a administração local deve então justificar seu tratamento de dados de outra forma.
Cloud Act
A lei americana de 2018 permite que as autoridades dos Estados Unidos exijam de um fornecedor sujeito à sua legislação a entrega de dados, independentemente de onde eles estejam armazenados. Uma hospedagem em um centro de dados europeu de um fornecedor americano não protege contra essa exigência. É exatamente isso que o referencial SecNumCloud da ANSSI busca excluir.
Diretriz 'nuvem no centro'
A circular do primeiro-ministro de 2021, atualizada em 2023, exige que os órgãos da administração do Estado hospedem dados sensíveis em serviços qualificados SecNumCloud e protegidos contra legislações extraterritoriais. Ela não se aplica diretamente às coletividades territoriais, mas define o nível de exigência que um representante eleito ou um DPO pode tomar como referência, e as prefeituras departamentais francesas se inspiram nela em seus diálogos com as coletividades territoriais.
Análise de impacto
O processamento de dados dos cidadãos por uma IA generativa, na escala de uma administração local, está entre os casos em que uma análise de impacto relativa à proteção de dados (artigo 35 do RGPD) é fortemente recomendada. Ela é muito mais simples de redigir quando não há transferência nem subcontratante.
Sigilo e dados sensíveis
Os serviços sociais (CCAS), a polícia municipal e os serviços de registro civil lidam com dados de saúde, infrações e situações familiares. Essas categorias estão excluídas das condições de uso da maioria dos serviços de IA para o público em geral, e seu envio para um terceiro sem vínculo contratual constitui uma violação de dados que deve ser notificada à CNIL.

Com hospedagem própria, a maioria desses pontos desaparece pela própria concepção da solução. Restam obrigações, e elas são reais: manter o registro das operações de tratamento atualizado com essa nova ferramenta, definir os prazos de retenção das conversas, informar os servidores e estabelecer diretrizes de uso em uma política. Mas são obrigações que a administração local já sabe cumprir para seus outros softwares.

!
A auto-hospedagem não dispensa o cumprimento do RGPD
Mesmo com um servidor na sala de informática da prefeitura, ainda há tratamento de dados pessoais. O DPO deve ser envolvido desde a definição do escopo, a ferramenta deve ser incluída no registro e os registros de conversa devem estar sujeitos a um prazo de retenção definido. A vantagem do uso local é tornar essas obrigações simples, não eliminá-las.

#Pré-requisitos e governança

Antes de comprar equipamentos, três decisões a tomar em reunião, não diante de um terminal.

Quem está por trás do projeto
Uma dupla: um responsável pela área de negócio (diretor-geral de serviços, secretário-geral) e uma pessoa de referência técnica (responsável por TI, o prestador de serviços de TI do município ou o serviço compartilhado da estrutura intermunicipal). Sem um responsável pela área de negócio, o projeto continua sendo um brinquedo do setor de TI.
Onde o servidor está rodando
Na administração territorial, no centro de dados da associação intermunicipal ou do departamento francês, ou em um provedor de hospedagem francês. As três opções são compatíveis com este guia. Para um município pequeno, o serviço de TI compartilhado da comunidade de municípios costuma ser a melhor opção: um servidor, dez prefeituras.
Quais dados entram
Decidir antecipadamente quais documentos alimentarão o RAG (regulamentos, deliberações publicadas, procedimentos internos) e o que não será incluído (dossiês individuais do CCAS, dados da polícia municipal). Essa lista é o núcleo da entrada no registro de atividades de tratamento.
Competências
Um técnico familiarizado com Linux e Docker basta para a instalação e a operação. O RAG exige um pouco mais de método (preparação dos documentos), mas não mais código.
Rede
O servidor deve ser acessível a partir dos computadores dos servidores públicos (rede interna ou VPN) e nunca deve ser exposto diretamente na internet. Um proxy reverso com autenticação é o mínimo se o acesso ultrapassar a rede local.

Quanto à compra, uma máquina com preço inferior a 40.000 € sem impostos se enquadra nas contratações públicas sem publicidade nem concorrência prévia, o que abrange todas as configurações deste guia. Ainda assim, é necessário solicitar orçamentos para comparação e incluir no processo uma justificativa da necessidade. Aliás, a maioria das configurações descritas abaixo pode ser comprada pelo catálogo da UGAP ou com o montador habitual da administração local.

#Dimensionar servidor e orçamento

A questão que determina tudo é o tamanho do modelo que você quer disponibilizar e, portanto, a memória de vídeo (VRAM) disponível. Com a quantização Q4_K_M, a mais comum, um modelo de 7 a 8 bilhões de parâmetros ocupa cerca de 5 GB, um de 14B cerca de 9 GB, um de 24 a 32B entre 15 e 19 GB e um de 70B cerca de 40 GB. É preciso acrescentar a memória do contexto (os documentos que estão sendo lidos), que cresce rapidamente com textos longos. O número de funcionários usando o sistema simultaneamente importa menos do que se imagina: em uma prefeitura, dez funcionários equipados raramente geram mais de duas ou três requisições ao mesmo tempo.

Três níveis cobrem quase todas as administrações locais. As faixas de preço abaixo são estimativas aproximadas, a serem confirmadas por orçamento: variam conforme o fornecedor, a memória, o armazenamento e a garantia.

Nível 1: município com menos de 5.000 habitantes
Uma estação de trabalho ou um minisservidor com uma placa de 12 ou 16 GB de VRAM (tipo RTX 4070, RTX 4080 ou equivalente), 32 GB de RAM e SSD de 1 TB. Modelos-alvo: Qwen3 8B ou 14B, Gemma 3 12B. Orçamento indicativo para hardware de 1.500 a 2.500 €, sem impostos. Cinco a dez funcionários, redação e resumo, RAG sobre os regulamentos do município.
Nível 2: cidade de médio porte ou agrupamento intermunicipal
Uma estação com uma placa de 24 GB (RTX 4090 ou equivalente profissional), 64 GB de RAM, 2 TB de SSD, ou um Mac Studio com 64 GB de memória unificada. Modelos-alvo: Mistral Small 24B, Qwen3 32B em Q4, gpt-oss 20B. Orçamento indicativo de 3.500 a 6.000 € sem impostos. Vinte a cinquenta servidores públicos, todos os casos de uso deste guia.
Nível 3: ente territorial de grande porte ou serviço compartilhado em âmbito departamental
Um servidor para montagem em rack com uma ou duas placas profissionais de 48 GB (ou mais), alimentação redundante, integrado à sala de servidores existente. Modelos-alvo: 70B em Q4, ou vários modelos especializados disponibilizados em paralelo. Orçamento indicativo a partir de 10.000 € sem impostos, frequentemente de 15.000 a 25.000 € sem impostos com suporte do fabricante. Várias centenas de servidores públicos, várias administrações locais integrantes.

A esses valores somam-se os custos de eletricidade (uma estação com uma placa voltada ao consumidor consome entre 300 e 500 W sob carga e muito pouco em repouso), alguns dias de instalação e configuração pelo responsável técnico ou por um prestador de serviços e, sobretudo, o tempo de capacitação dos servidores públicos, que é o verdadeiro custo do projeto. Para comparação, uma assinatura de um assistente de IA proprietário para cinquenta servidores públicos geralmente supera o preço do nível 2 já no primeiro ano e é renovada a cada ano.

→
O Mac é uma opção séria para pequenas administrações locais
Um Mac mini ou Mac Studio com 48 a 64 GB de memória unificada roda um modelo de 32B sem placa gráfica dedicada, com consumo muito baixo e administração simples. Seu desempenho em taxa de processamento é inferior ao de uma RTX 4090, mas é mais do que suficiente para cerca de dez agentes, e o equipamento é fácil de adquirir nos catálogos públicos.

#Implantação passo a passo

O procedimento abaixo pressupõe um servidor Linux (Ubuntu ou Debian) com uma placa NVIDIA e os drivers instalados. A stack usa o Ollama para servir os modelos e o Open WebUI como interface, com contas de usuários, histórico e RAG integrado.

  1. 01
    Instalar Ollama e torná-lo acessível na rede
    O script oficial instala o Ollama como serviço systemd. Por padrão, ele escuta apenas na própria máquina (http://localhost:11434). Para que a interface, instalada em um contêiner, consiga se conectar a ele, configura-se o Ollama para escutar em todas as interfaces, garantindo que o firewall do servidor bloqueie o acesso externo à porta 11434.
  2. 02
    Baixar um ou dois modelos
    Comece com um modelo de tamanho médio e um modelo pequeno e rápido. O primeiro para redação e síntese, o segundo para tarefas curtas e atendimento. O download envolve vários gigabytes e deve ser planejado para fora do horário de funcionamento se a conexão da prefeitura for limitada.
  3. 03
    Instalar Open WebUI
    O Open WebUI é instalado em um contêiner Docker e se conecta ao Ollama. A primeira conta criada é de administrador. Depois, desative o cadastro livre e crie as contas dos funcionários manualmente ou via diretório (LDAP ou SSO são compatíveis com as configurações de administração).
  4. 04
    Alimentar a base de documentos
    No espaço de trabalho do Open WebUI, crie uma coleção por tema (normas, deliberações, procedimentos de RH) e carregue os PDFs e documentos Word. Prefira documentos limpos, atualizados, sem páginas digitalizadas como imagens. Em seguida, vincule cada coleção a um modelo personalizado com um prompt de sistema que descreva o papel esperado.
  5. 05
    Escrever prompts de sistema por área de atuação
    Um modelo personalizado « Correspondência administrativa » com as diretrizes de redação da administração local, um « Deliberação » com a estrutura esperada e dois exemplos, um « Atendimento » conectado à coleção de informações práticas. Esses modelos aparecem como ferramentas prontas para uso pelos funcionários, que não precisam saber criar prompts.
  6. 06
    Proteger e fazer backup
    Proxy reverso com certificado TLS à frente do Open WebUI, acesso limitado à rede interna ou à VPN, backup diário do volume de dados do Open WebUI (contas, conversas, documentos) e da configuração. Registre a ferramenta no registro das atividades de tratamento, definindo um prazo de retenção das conversas, e configure a exclusão de acordo com esse prazo.
Terminal (servidor Linux)
# Installation d'Ollama (script officiel)
curl -fsSL https://ollama.com/install.sh | sh

# Écouter sur le réseau pour le conteneur Open WebUI
sudo systemctl edit ollama.service
# Ajouter dans le fichier ouvert :
# [Service]
# Environment="OLLAMA_HOST=0.0.0.0"
# Environment="OLLAMA_KEEP_ALIVE=24h"
sudo systemctl daemon-reload
sudo systemctl restart ollama

# Modèles de départ (Q4_K_M par défaut)
ollama pull qwen3:14b
ollama pull mistral-small3.2
ollama pull qwen3:8b

# Vérification
ollama list
curl http://localhost:11434/api/tags
Terminal (Open WebUI via Docker)
docker run -d -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui --restart always \
  ghcr.io/open-webui/open-webui:main

# L'interface est ensuite accessible sur http://<ip-du-serveur>:3000
# Premier compte créé = administrateur
# Ensuite : Admin > Settings > désactiver « Enable New Sign Ups »

Para não deixar a porta 11434 aberta para toda a rede, restrinja o acesso ao próprio servidor e ao contêiner usando o firewall (ufw ou nftables). O guia do site sobre como proteger um servidor Ollama detalha essa parte, bem como a configuração do proxy reverso. Se a administração local já dispõe de um hipervisor Proxmox, uma máquina virtual com passthrough da placa de vídeo é uma boa forma de integrar esse servidor à infraestrutura existente.

i
Licenças dos modelos e da interface
Verifique a licença de cada modelo antes de adotá-lo em um serviço público: Mistral Small, Qwen3 e gpt-oss estão sob Apache 2.0; Gemma 3 e Llama estão sob licenças próprias de seus respectivos fornecedores, mais restritivas. O Open WebUI também adotou, em 2025, uma licença que exige manter sua marca na interface acima de um certo número de usuários, salvo acordo comercial. Nada disso impede o uso por uma administração local, mas deve ser documentado no dossiê do projeto.

#Acompanhar os servidores públicos sem substituí-los

O medo de ser substituído é a primeira reação em um setor quando se anuncia uma IA. Esse medo é legítimo, e responder a ele com slogans não funciona. O que funciona é dizer com precisão o que a ferramenta faz e não faz, e demonstrar isso no trabalho real dos servidores.

O modelo propõe, o servidor público decide
Nenhum documento gerado pelo modelo é enviado sem revisão e assinatura humana. Essa regra consta na política de uso, e o prompt de sistema de cada modelo personalizado a relembra no rodapé da resposta. Ela protege a administração local (responsabilidade) e o servidor público (ele continua sendo o autor).
Treinar com casos reais
Duas horas por departamento, trabalhando com as correspondências e os processos da semana, não com exemplos genéricos. O objetivo é que cada servidor saia com três situações em que a ferramenta lhe economiza tempo e duas em que não deve usá-la.
Explicar as alucinações
Um modelo local inventa referências jurídicas, artigos de códigos legais e números com a mesma confiança com que dá uma resposta correta. Os servidores devem saber que toda referência legal produzida pelo modelo deve ser verificada no Légifrance e que o RAG reduz esse risco nos documentos da administração local, sem eliminá-lo.
Tornar o uso visível
Uma convenção interna: incluir a menção « redigido com a ajuda de um assistente, revisado por [agent] » nos documentos de trabalho, nunca nos atos oficiais. Ela desdramatiza o uso e facilita o controle.
Envolver os representantes dos funcionários
A introdução de uma ferramenta de IA afeta a organização do trabalho. Informar o Comitê Social Territorial (CST) antes da implantação evita que ele fique sabendo por rumores e transforme o projeto em um conflito.
Medir sem vigiar
Acompanhe o número de usuários ativos e os comentários qualitativos, não a produtividade individual. Os registros de conversa servem para solucionar problemas e garantir a conformidade, não para avaliar os servidores públicos, e a carta de princípios deve deixar isso claro.

Nas administrações locais que procederam dessa forma, a adoção não apresenta problemas: os servidores aderem de bom grado a uma ferramenta que elimina a parte ingrata da elaboração de uma correspondência. O ponto de atenção está em outro lugar: alguns servidores confiam excessivamente no modelo e deixam de reler. A revisão cruzada nas primeiras semanas e lembretes regulares das alucinações constatadas são as melhores medidas de proteção.

#Armadilhas e solução de problemas

Respostas lentas ou com pausas
O modelo ultrapassa a VRAM e parte dele roda no processador. Verifique com o ollama ps a distribuição GPU/CPU. Use um modelo menor, uma quantização mais agressiva ou reduza o tamanho de contexto solicitado por Open WebUI.
O RAG dá respostas que não correspondem à pergunta
Na maioria das vezes, os documentos estão mal divididos (PDFs escaneados, tabelas, layouts complexos). Converta-os em texto limpo antes de enviá-los, remova as versões obsoletas dos regulamentos e teste cada coleção com dez perguntas cujas respostas você conhece.
O modelo não conhece o vocabulário territorial
Ele não sabe o que é um CCAS, uma DETR ou uma DSP no seu contexto. Adicione um glossário da administração local no prompt do sistema ou em uma coleção dedicada.
Um funcionário colou um dossiê de assistência social em uma conversa
Isso não é um vazamento para fora da administração local, mas é um tratamento de dados fora do escopo permitido. Exclua a conversa, relembre as regras da política de uso e, se necessário, ajuste as permissões de acesso aos modelos por grupo de usuários no Open WebUI.
Atualização que quebra tudo
Fixe as versões: tag da imagem Open WebUI, versão de Ollama, lista exata dos modelos. Teste as atualizações em uma máquina secundária ou em uma máquina virtual antes de tocar no servidor dos agentes.
O servidor está acessível a partir do exterior da rede
Verifique regularmente se nenhum redirecionamento de porta ou regra de firewall expõe a porta 11434 ou a porta do Open WebUI no endereço público da prefeitura. Milhares de servidores Ollama abertos são identificados continuamente na internet.

#Para se aprofundar

Este guia apresenta o contexto e a implantação básica. Estes guias do site detalham os componentes que você vai utilizar em seguida:

Implantar um chatbot de IA para sua equipe na intranet
Detalhes do proxy reverso Nginx, da autenticação, do monitoramento e do backup das conversas para uma implantação do Open WebUI com vários usuários.
Proteger seu servidor Ollama
Verificar a exposição do servidor, adicionar autenticação e TLS e adotar boas práticas de rede. Ler antes de permitir acesso de fora da rede local.
LLM local e RGPD: conformidade na proteção de dados pessoais
O quadro legal completo (RGPD, regulamento europeu sobre IA, recomendações da CNIL) para documentar a análise de impacto e a entrada no registro.
RAG local com Ollama sem programar
Para entender o que acontece quando você insere documentos em uma coleção e melhorar a qualidade das respostas do atendimento.
Escolher sua quantização (Q4, Q5, Q8, FP16)
Para escolher entre um modelo maior em Q4 e um modelo menor em Q8 de acordo com a VRAM do servidor comprado.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.