Implantar um chatbot de IA interno para pequenas e médias empresas (de 0 a 50 collaborateurs)
Você dirige uma pequena ou média empresa com menos de 50 colaboradores e quer oferecer um assistente de IA às suas equipes sem enviar os dados delas para a OpenAI. Este guia apresenta uma stack completa, com custos detalhados, para a implantação de um chatbot de IA interno em uma pequena ou média empresa: hardware específico, softwares open source, SSO da Microsoft, plano de 4 semanas, gestão da mudança e cálculo de ROI. Sem promessas vazias, sem discurso de venda — a lista de compras e o calendário.
#Por que um chatbot interno em vez de ChatGPT Business
ChatGPT Team custa 25 € por usuário por mês. Para 30 colaboradores, isso dá 9.000 € por ano, indefinidamente. Com o mesmo orçamento, você compra uma estação de trabalho que funciona por 4 a 5 anos, e suas conversas nunca saem do escritório. Essa é a decisão central.
Mas o verdadeiro assunto não é o preço. É o que suas equipes colocam na janela do chat. Um comercial que pede a um LLM externo para reformular uma proposta contém o nome de um cliente, um valor, às vezes uma margem. Uma área de RH que resume uma entrevista revela uma trajetória profissional. Multiplique por 30 pessoas durante 12 meses — a fuga é garantida, mesmo com uma política de uso responsável.
- Privacidade
- As conversas permanecem em sua LAN. Sem transito no Cloud Act, sem exposição a um subcontratado norte-americano, sem ajustes políticos para verificar a cada trimestre.
- Custo fixo
- O hardware é um CAPEX amortizado em 4 a 5 anos. A assinatura SaaS é um OPEX que aumenta com o número de colaboradores.
- Controle
- Você escolhe o modelo, ajusta o system prompt e conecta seus documentos internos via RAG. Ninguém altera sua ferramenta sem você saber.
- Conformidade
- É mais fácil justificar a conformidade com o AI Act e o RGPD com um sistema on-premise do que dependendo de um fornecedor de fora da União Europeia.
#1. Orçamento de hardware: a workstation de 5.000 a 10.000 €
Implantar uma IA local no trabalho: RGPD, AI Act, arquitetura multiusuário, custos, nota para a diretoria.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
Para atender de 30 a 50 usuários simultâneos com um modelo de 20B a 35B em qualidade Q4_K_M, você não precisa de um servidor DGX. Uma estação de trabalho bem escolhida dá conta da carga. Aqui estão três configurações conforme o perfil.
#Perfil A — 10 a 20 usuários (5.000 €)
- GPU
- 1× RTX 4080 de 16 GB usada (preço variável) ou RTX 5070 Ti de 16 GB nova (≈ 1 400 € no final de setembro de 2026). Executa um modelo de 20-24B em Q4_K_M com um contexto de 16k tokens.
- CPU
- AMD Ryzen 9 7900X ou Intel Core i7-14700K. Pouco crítico, mas 12+ núcleos ajudam na preparação dos embeddings.
- RAM do sistema
- 64 GB DDR5. Suficiente para o sistema, o Qdrant e a parcela do cache KV que não cabe na memória da GPU.
- Armazenamento
- 2 TB NVMe Gen4. Modelos + base vetorial + backups locais.
- Modelo disponibilizado
- Mistral Small 24B (generalista, bom em francês) ou gpt-oss 20B em Q4_K_M (~14 GB de VRAM). Latência ~30 tok/s.
#Perfil B — 20 a 35 usuários (7 500 €)
- GPU
- 1× RTX 4090 24 GB — não é mais vendida nova; procure uma usada (preço variável). O equilíbrio ideal para servir um modelo de 27-30B em Q4_K_M.
- CPU
- Ryzen 9 7950X ou Threadripper 7960X. Núcleos úteis para atender a várias conversas simultâneas.
- RAM do sistema
- 128 GB DDR5 ECC, se possível. O índice RAG cresce rapidamente.
- Armazenamento
- 2 TB NVMe Gen4 + 4 TB SATA para arquivamento.
- Modelo disponibilizado
- Qwen 3.8 27B (o modelo « próximo do Copilot » de 2026, 262k ctx) ou Granite 4.2 30B em Q4_K_M (~18 GB de VRAM). Latência ~20-25 tok/s.
#Perfil C — 35 a 50 usuários (10.000 €)
- Opção NVIDIA
- 2× RTX 4090 de 24 GB em paralelismo de tensores. Serve um modelo de 27–35B em Q8 com qualidade plena (~30–40 GB de VRAM distribuídos) ou executa dois modelos em paralelo, com latência aceitável.
- Opção Apple
- Mac Studio M4 Max ou Ultra com 64 a 128 GB de memória unificada. Excelente relação entre silêncio e desempenho, ideal em escritórios de planta aberta.
- CPU
- Threadripper 7970X / 7980X para configurações NVIDIA. Essencial para gerenciar 50 conexões WebSocket simultâneas.
- RAM do sistema
- 128 a 256 GB. Margem para o cache do sistema, Qdrant em RAM e um possível modelo de embeddings adicional.
- Modelo disponibilizado
- Qwen 3.8 27B em Q8 ou Qwen 3.6 35B-A3B (MoE rápido) em Q5_K_M. Latência ~15-20 tok/s.
#2. Stack técnica recomendada
Quatro componentes open source são suficientes. Nenhum fornecedor de software tem direito de supervisão, não há licença a renovar e tudo roda em Docker na estação de trabalho.
- Ollama
- O daemon que carrega e serve o modelo. Escuta por padrão em http://localhost:11434. Detecta a GPU NVIDIA automaticamente e gerencia a quantização. Licença MIT.
- Open WebUI
- Interface web do tipo ChatGPT. Suporte nativo a múltiplos usuários, RBAC, integração OIDC para SSO, histórico por usuário. Licença BSD-3.
- Qdrant
- Base vetorial para o RAG. Indexa seus documentos internos (procedimentos, contratos padrão, fichas de produto). Mais rápido e mais simples que pgvector para esse volume. Licença Apache 2.
- Traefik ou Nginx
- Proxy reverso para expor o Open WebUI via HTTPS na LAN com um certificado interno, realizar a terminação TLS e rotear para os backends.
Esse esqueleto é intencionalmente curto. Você adicionará o Traefik como uma camada acima para HTTPS e um volume bind-mount para os backups noturnos para o NAS. Nada além disso.
#3. SSO com Microsoft Entra ID
A maioria das PMEs usa Microsoft 365. Integrar a autenticação do chatbot ao Entra ID (ex-Azure AD) elimina contas órfãs e garante que um funcionário que sai da empresa perca o acesso no mesmo dia. O Open WebUI oferece suporte nativo a OIDC com a Microsoft.
- 01Criar um registro de aplicativo (App registration)No portal Entra ID, App registrations → New registration. Nome: « Chatbot IA Interne ». Redirect URI: https://chatbot.votreboite.local/oauth/microsoft/callback (tipo Web).
- 02Recuperar os identificadoresAnote o Application (client) ID e o Directory (tenant) ID. Em Certificates & secrets, gere um Client secret com validade de 24 meses e anote-o imediatamente (ele nunca mais será exibido).
- 03Definir as permissõesAPI permissions → Microsoft Graph → Delegated: openid, profile, email, User.Read. Não são necessárias Application permissions; o fluxo é delegado.
- 04Restringir o acessoEnterprise applications → seu aplicativo → Properties → Assignment required = Yes. Em seguida, Users and groups: adicione o grupo "Todos os colaboradores" ou um grupo piloto. Sem essa etapa, qualquer conta do tenant pode fazer login.
- 05Injetar no Open WebUICopie CLIENT_ID, CLIENT_SECRET e TENANT_ID no .env do docker-compose. Reinicie. O botão «Sign in with Microsoft» aparece na página de login.
#4. Plano de implantação em 4 semanas
Este cronograma pressupõe um responsável técnico interno (DSI, gerente de TI ou prestador de serviços) que dedica ~50 % do seu tempo ao projeto. Não é preciso mais do que isso para uma PME.
#Semana 1 — Hardware e instalação
- J1-J2
- Pedido de hardware (workstation, nobreak de 1500 VA, switch gerenciado caso ainda não esteja instalado).
- J3-J4
- Recebimento, montagem se necessário, instalação do Ubuntu Server LTS 24.04, drivers NVIDIA, Docker + NVIDIA Container Toolkit.
- J5
- Download das imagens Docker, primeira execução de ollama pull mistral-small e teste de chat diretamente na CLI. Você deve ver tokens aparecendo.
#Semana 2 — Stack e integrações
- J6-J7
- docker-compose up, configuration Open WebUI (admin, paramètres généraux, branding interne).
- J8-J9
- Configuração SSO Entra ID, teste com 3 contas piloto, validação do fluxo de login e logout.
- J10
- Proxy reverso Traefik com certificado interno via sua PKI ou Let's Encrypt DNS-01 se o domínio for público. Teste a partir de 2 a 3 computadores da rede local.
#Semana 3 — RAG e piloto
- J11-J12
- Seleção de 50 a 200 documentos internos relevantes (procedimentos, FAQ, fichas comerciais). Indexação no Qdrant via Open WebUI ou script Python.
- J13-J14
- System prompt com a identidade da PME: tom, assuntos autorizados, assuntos a recusar (RH sensível, salários, etc.). Teste com os 3 pilotos.
- J15
- Abertura a um grupo piloto de 5 a 8 colaboradores representativos (1 da área comercial, 1 de RH, 1 da contabilidade, 1 de operações…). Coleta de feedback estruturado.
#Semana 4 — Treinamento e transição
- J16-J17
- Ajustes com base no feedback do piloto (system prompt, documentos RAG, parâmetros de temperatura).
- J18
- Sessão de treinamento coletivo de 1h30: demonstração, casos de uso por área de atuação, regras de uso, o que NÃO deve ser colocado no chat (dados de saúde, identificadores, etc.).
- J19
- Abertura progressiva para todos os colaboradores via grupo Entra ID. Anúncio interno.
- J20
- Instalação do monitoramento (Glances ou Netdata para a workstation, log de conversas agregado para identificar os temas solicitados).
#5. Treinamento e gestão da mudança
Um chatbot interno sem treinamento significa desperdiçar 70% do investimento. Os colaboradores não sabem o que perguntar a ele, comparam-no mentalmente com o ChatGPT voltado ao público geral e concluem que « é pior » após duas tentativas.
- Formato
- Uma sessão coletiva de 1h30 por grupo de 10 a 15 pessoas. Sem slides durante 1h. 20 minutos de demonstração + 1h de prática com seus temas reais.
- Casos de uso por função
- Prepare 3 prompts concretos por função (RH, comercial, contabilidade, operações, direção). As pessoas copiam e adaptam — é exatamente o que queremos.
- Regras de uso
- Mostre claramente o que pode ser colado (textos internos, rascunhos, dados já públicos) e o que não deve ser colado (dados de saúde, condenações, dados bancários vinculados a pessoas identificadas, identificadores técnicos).
- Responsável
- Designe 1 pessoa de referência em IA por departamento. É essa pessoa que dissemina as boas práticas localmente e comunica as lacunas de conhecimento do RAG.
- Acompanhamento após 30 dias
- Meça o uso. Se alguns departamentos não usam a ferramenta, isso é um sinal — falta um caso de uso evidente para eles, ou o treinamento não surtiu efeito.
#6. Conformidade com o RGPD e a Lei da IA
O fato de o sistema estar on-premise simplifica drasticamente a conformidade, mas não a elimina. As obrigações do RGPD se aplicam ao tratamento, não à localização.
- Registro das atividades de tratamento
- Adicione uma ficha para o chatbot interno. Finalidade: auxílio na redação e pesquisa documental. Base legal: interesse legítimo do empregador. Dados tratados: conteúdo das conversas, identificador SSO.
- Prazo de retenção
- Defina uma política clara: 90 dias de histórico de conversas por usuário, com exclusão automática após esse prazo. Documente-a na carta de princípios.
- Informação aos colaboradores
- Atualização da política de uso dos recursos de TI e da nota informativa CSE/CSE. Mencione explicitamente que as conversas são armazenadas e podem ser acessadas pelo administrador técnico em caso de incidente.
- AI Act
- Um assistente de chat interno de produtividade cai na categoria "risco limitado" (artigo 50). Obrigação principal: informar o usuário que está interagindo com uma IA — a interface Open WebUI faz isso por padrão.
- Segurança técnica
- Backups criptografados do banco de dados do Open WebUI, acesso administrativo registrado, MFA obrigatório nas contas Entra ID, atualização mensal das imagens Docker.
#7. ROI: cálculo honesto
Vamos considerar uma PME com 30 colaboradores, com implantação do Perfil A por 5.000 €. Em um horizonte de 3 anos.
- Custo da alternativa SaaS
- 30 × 25 € × 12 meses × 3 anos = 27.000 € (ChatGPT Team).
- Custo interno
- Workstation de 5 000 € + eletricidade ~200 €/ano + 5 dias-homem de instalação no 1º ano (~3 500 €) + 2 dias-homem/ano de manutenção (~1 400 €/ano × 2 anos) = ~11 500 € em 3 anos.
- Economia líquida direta
- ~15 500 € ao longo de 3 anos, ou aproximadamente 5 200 € por ano a partir do ano 2.
- Ganhos indiretos
- Redução do risco de vazamento de dados (quantificável ao considerar que um único vazamento evitado cobre com folga o custo do projeto), conformidade com o RGPD facilitada, independência em relação aos aumentos de preços dos serviços SaaS.
- Aumento da produtividade
- Estimativa prudente: 15 minutos economizados por usuário e por dia útil. Com um custo de 35 €/h incluindo encargos e considerando 220 dias, isso equivale a cerca de 38.500 € por ano para 30 pessoas. Esse valor depende fortemente da adoção real — seja cauteloso ao elaborar estudos de viabilidade econômica.
#Para se aprofundar
Este guia estabelece a base. Três caminhos naturais a seguir: adicionar um RAG robusto sobre seus documentos internos para que o chatbot conheça seus procedimentos, reforçar a segurança da implantação multiusuário na intranet e formalizar a conformidade com o RGPD com um dossiê bem organizado.
Os preços mudam rápido: nosso monitoramento registra toda segunda e quinta-feira o menor preço das placas de vídeo para IA local, com o preço por GB de VRAM.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.