Intermediário 20 minCaso de uso

Implantar um chatbot de IA interno para pequenas e médias empresas (de 0 a 50 collaborateurs)

Você dirige uma pequena ou média empresa com menos de 50 colaboradores e quer oferecer um assistente de IA às suas equipes sem enviar os dados delas para a OpenAI. Este guia apresenta uma stack completa, com custos detalhados, para a implantação de um chatbot de IA interno em uma pequena ou média empresa: hardware específico, softwares open source, SSO da Microsoft, plano de 4 semanas, gestão da mudança e cálculo de ROI. Sem promessas vazias, sem discurso de venda — a lista de compras e o calendário.

Por Mohamed Meguedmi·Atualização 2026-08-27·Testado no Windows, macOS e Linux

#Por que um chatbot interno em vez de ChatGPT Business

ChatGPT Team custa 25 € por usuário por mês. Para 30 colaboradores, isso dá 9.000 € por ano, indefinidamente. Com o mesmo orçamento, você compra uma estação de trabalho que funciona por 4 a 5 anos, e suas conversas nunca saem do escritório. Essa é a decisão central.

Mas o verdadeiro assunto não é o preço. É o que suas equipes colocam na janela do chat. Um comercial que pede a um LLM externo para reformular uma proposta contém o nome de um cliente, um valor, às vezes uma margem. Uma área de RH que resume uma entrevista revela uma trajetória profissional. Multiplique por 30 pessoas durante 12 meses — a fuga é garantida, mesmo com uma política de uso responsável.

Privacidade
As conversas permanecem em sua LAN. Sem transito no Cloud Act, sem exposição a um subcontratado norte-americano, sem ajustes políticos para verificar a cada trimestre.
Custo fixo
O hardware é um CAPEX amortizado em 4 a 5 anos. A assinatura SaaS é um OPEX que aumenta com o número de colaboradores.
Controle
Você escolhe o modelo, ajusta o system prompt e conecta seus documentos internos via RAG. Ninguém altera sua ferramenta sem você saber.
Conformidade
É mais fácil justificar a conformidade com o AI Act e o RGPD com um sistema on-premise do que dependendo de um fornecedor de fora da União Europeia.
i
A quem este guia se destina
Pequenas e médias empresas de 5 a 50 colaboradores, com ou sem uma área interna de TI. Se sua empresa tiver 200 pessoas ou mais, algumas decisões mudam (migração para vLLM, alta disponibilidade, gestão estruturada de chamados) — este guia continua válido como base.

#1. Orçamento de hardware: a workstation de 5.000 a 10.000 €

O kit IA Local na Empresa

Implantar uma IA local no trabalho: RGPD, AI Act, arquitetura multiusuário, custos, nota para a diretoria.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Para atender de 30 a 50 usuários simultâneos com um modelo de 20B a 35B em qualidade Q4_K_M, você não precisa de um servidor DGX. Uma estação de trabalho bem escolhida dá conta da carga. Aqui estão três configurações conforme o perfil.

#Perfil A — 10 a 20 usuários (5.000 €)

GPU
1× RTX 4080 de 16 GB usada (preço variável) ou RTX 5070 Ti de 16 GB nova (≈ 1 400 € no final de setembro de 2026). Executa um modelo de 20-24B em Q4_K_M com um contexto de 16k tokens.
CPU
AMD Ryzen 9 7900X ou Intel Core i7-14700K. Pouco crítico, mas 12+ núcleos ajudam na preparação dos embeddings.
RAM do sistema
64 GB DDR5. Suficiente para o sistema, o Qdrant e a parcela do cache KV que não cabe na memória da GPU.
Armazenamento
2 TB NVMe Gen4. Modelos + base vetorial + backups locais.
Modelo disponibilizado
Mistral Small 24B (generalista, bom em francês) ou gpt-oss 20B em Q4_K_M (~14 GB de VRAM). Latência ~30 tok/s.

#Perfil B — 20 a 35 usuários (7 500 €)

GPU
1× RTX 4090 24 GB — não é mais vendida nova; procure uma usada (preço variável). O equilíbrio ideal para servir um modelo de 27-30B em Q4_K_M.
CPU
Ryzen 9 7950X ou Threadripper 7960X. Núcleos úteis para atender a várias conversas simultâneas.
RAM do sistema
128 GB DDR5 ECC, se possível. O índice RAG cresce rapidamente.
Armazenamento
2 TB NVMe Gen4 + 4 TB SATA para arquivamento.
Modelo disponibilizado
Qwen 3.8 27B (o modelo « próximo do Copilot » de 2026, 262k ctx) ou Granite 4.2 30B em Q4_K_M (~18 GB de VRAM). Latência ~20-25 tok/s.

#Perfil C — 35 a 50 usuários (10.000 €)

Opção NVIDIA
2× RTX 4090 de 24 GB em paralelismo de tensores. Serve um modelo de 27–35B em Q8 com qualidade plena (~30–40 GB de VRAM distribuídos) ou executa dois modelos em paralelo, com latência aceitável.
Opção Apple
Mac Studio M4 Max ou Ultra com 64 a 128 GB de memória unificada. Excelente relação entre silêncio e desempenho, ideal em escritórios de planta aberta.
CPU
Threadripper 7970X / 7980X para configurações NVIDIA. Essencial para gerenciar 50 conexões WebSocket simultâneas.
RAM do sistema
128 a 256 GB. Margem para o cache do sistema, Qdrant em RAM e um possível modelo de embeddings adicional.
Modelo disponibilizado
Qwen 3.8 27B em Q8 ou Qwen 3.6 35B-A3B (MoE rápido) em Q5_K_M. Latência ~15-20 tok/s.
→
Não especifique o dia 1 com excesso
Comece com o perfil A mesmo que vocês sejam 40 pessoas. A maioria dos usuários não faz perguntas ao mesmo tempo. Você medirá o tempo de espera real após 3 semanas e atualizará a placa de vídeo, se necessário. A placa-mãe e a fonte devem, no entanto, suportar uma placa de vídeo maior desde o início.

#2. Stack técnica recomendada

Quatro componentes open source são suficientes. Nenhum fornecedor de software tem direito de supervisão, não há licença a renovar e tudo roda em Docker na estação de trabalho.

Ollama
O daemon que carrega e serve o modelo. Escuta por padrão em http://localhost:11434. Detecta a GPU NVIDIA automaticamente e gerencia a quantização. Licença MIT.
Open WebUI
Interface web do tipo ChatGPT. Suporte nativo a múltiplos usuários, RBAC, integração OIDC para SSO, histórico por usuário. Licença BSD-3.
Qdrant
Base vetorial para o RAG. Indexa seus documentos internos (procedimentos, contratos padrão, fichas de produto). Mais rápido e mais simples que pgvector para esse volume. Licença Apache 2.
Traefik ou Nginx
Proxy reverso para expor o Open WebUI via HTTPS na LAN com um certificado interno, realizar a terminação TLS e rotear para os backends.
docker-compose.yml — esqueleto mínimo
services:
  ollama:
    image: ollama/ollama:latest
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
    volumes:
      - ollama_data:/root/.ollama
    restart: unless-stopped

  qdrant:
    image: qdrant/qdrant:latest
    volumes:
      - qdrant_data:/qdrant/storage
    restart: unless-stopped

  openwebui:
    image: ghcr.io/open-webui/open-webui:main
    environment:
      - OLLAMA_BASE_URL=http://ollama:11434
      - QDRANT_URL=http://qdrant:6333
      - ENABLE_OAUTH_SIGNUP=true
      - OAUTH_PROVIDER_NAME=Microsoft
      - MICROSOFT_CLIENT_ID=${ENTRA_CLIENT_ID}
      - MICROSOFT_CLIENT_SECRET=${ENTRA_CLIENT_SECRET}
      - MICROSOFT_CLIENT_TENANT_ID=${ENTRA_TENANT_ID}
    volumes:
      - openwebui_data:/app/backend/data
    depends_on:
      - ollama
      - qdrant
    restart: unless-stopped

volumes:
  ollama_data:
  qdrant_data:
  openwebui_data:

Esse esqueleto é intencionalmente curto. Você adicionará o Traefik como uma camada acima para HTTPS e um volume bind-mount para os backups noturnos para o NAS. Nada além disso.

#3. SSO com Microsoft Entra ID

A maioria das PMEs usa Microsoft 365. Integrar a autenticação do chatbot ao Entra ID (ex-Azure AD) elimina contas órfãs e garante que um funcionário que sai da empresa perca o acesso no mesmo dia. O Open WebUI oferece suporte nativo a OIDC com a Microsoft.

  1. 01
    Criar um registro de aplicativo (App registration)
    No portal Entra ID, App registrations → New registration. Nome: « Chatbot IA Interne ». Redirect URI: https://chatbot.votreboite.local/oauth/microsoft/callback (tipo Web).
  2. 02
    Recuperar os identificadores
    Anote o Application (client) ID e o Directory (tenant) ID. Em Certificates & secrets, gere um Client secret com validade de 24 meses e anote-o imediatamente (ele nunca mais será exibido).
  3. 03
    Definir as permissões
    API permissions → Microsoft Graph → Delegated: openid, profile, email, User.Read. Não são necessárias Application permissions; o fluxo é delegado.
  4. 04
    Restringir o acesso
    Enterprise applications → seu aplicativo → Properties → Assignment required = Yes. Em seguida, Users and groups: adicione o grupo "Todos os colaboradores" ou um grupo piloto. Sem essa etapa, qualquer conta do tenant pode fazer login.
  5. 05
    Injetar no Open WebUI
    Copie CLIENT_ID, CLIENT_SECRET e TENANT_ID no .env do docker-compose. Reinicie. O botão «Sign in with Microsoft» aparece na página de login.
!
A armadilha clássica: Assignment required
Se você esquecer a etapa 4, todo o seu tenant Microsoft pode potencialmente se conectar — o que inclui todas as contas de convidados externos (clientes, prestadores de serviços). Verifique duas vezes essa configuração antes de compartilhar a URL com as equipes.

#4. Plano de implantação em 4 semanas

Este cronograma pressupõe um responsável técnico interno (DSI, gerente de TI ou prestador de serviços) que dedica ~50 % do seu tempo ao projeto. Não é preciso mais do que isso para uma PME.

#Semana 1 — Hardware e instalação

J1-J2
Pedido de hardware (workstation, nobreak de 1500 VA, switch gerenciado caso ainda não esteja instalado).
J3-J4
Recebimento, montagem se necessário, instalação do Ubuntu Server LTS 24.04, drivers NVIDIA, Docker + NVIDIA Container Toolkit.
J5
Download das imagens Docker, primeira execução de ollama pull mistral-small e teste de chat diretamente na CLI. Você deve ver tokens aparecendo.

#Semana 2 — Stack e integrações

J6-J7
docker-compose up, configuration Open WebUI (admin, paramètres généraux, branding interne).
J8-J9
Configuração SSO Entra ID, teste com 3 contas piloto, validação do fluxo de login e logout.
J10
Proxy reverso Traefik com certificado interno via sua PKI ou Let's Encrypt DNS-01 se o domínio for público. Teste a partir de 2 a 3 computadores da rede local.

#Semana 3 — RAG e piloto

J11-J12
Seleção de 50 a 200 documentos internos relevantes (procedimentos, FAQ, fichas comerciais). Indexação no Qdrant via Open WebUI ou script Python.
J13-J14
System prompt com a identidade da PME: tom, assuntos autorizados, assuntos a recusar (RH sensível, salários, etc.). Teste com os 3 pilotos.
J15
Abertura a um grupo piloto de 5 a 8 colaboradores representativos (1 da área comercial, 1 de RH, 1 da contabilidade, 1 de operações…). Coleta de feedback estruturado.

#Semana 4 — Treinamento e transição

J16-J17
Ajustes com base no feedback do piloto (system prompt, documentos RAG, parâmetros de temperatura).
J18
Sessão de treinamento coletivo de 1h30: demonstração, casos de uso por área de atuação, regras de uso, o que NÃO deve ser colocado no chat (dados de saúde, identificadores, etc.).
J19
Abertura progressiva para todos os colaboradores via grupo Entra ID. Anúncio interno.
J20
Instalação do monitoramento (Glances ou Netdata para a workstation, log de conversas agregado para identificar os temas solicitados).

#5. Treinamento e gestão da mudança

Um chatbot interno sem treinamento significa desperdiçar 70% do investimento. Os colaboradores não sabem o que perguntar a ele, comparam-no mentalmente com o ChatGPT voltado ao público geral e concluem que « é pior » após duas tentativas.

Formato
Uma sessão coletiva de 1h30 por grupo de 10 a 15 pessoas. Sem slides durante 1h. 20 minutos de demonstração + 1h de prática com seus temas reais.
Casos de uso por função
Prepare 3 prompts concretos por função (RH, comercial, contabilidade, operações, direção). As pessoas copiam e adaptam — é exatamente o que queremos.
Regras de uso
Mostre claramente o que pode ser colado (textos internos, rascunhos, dados já públicos) e o que não deve ser colado (dados de saúde, condenações, dados bancários vinculados a pessoas identificadas, identificadores técnicos).
Responsável
Designe 1 pessoa de referência em IA por departamento. É essa pessoa que dissemina as boas práticas localmente e comunica as lacunas de conhecimento do RAG.
Acompanhamento após 30 dias
Meça o uso. Se alguns departamentos não usam a ferramenta, isso é um sinal — falta um caso de uso evidente para eles, ou o treinamento não surtiu efeito.
→
O que funciona melhor na demonstração
Três casos para mostrar primeiro: reformulação de um e-mail difícil, síntese de um longo relatório de reunião, tradução de um documento técnico. São os casos de uso em que o valor fica evidente em 30 segundos.

#6. Conformidade com o RGPD e a Lei da IA

O fato de o sistema estar on-premise simplifica drasticamente a conformidade, mas não a elimina. As obrigações do RGPD se aplicam ao tratamento, não à localização.

Registro das atividades de tratamento
Adicione uma ficha para o chatbot interno. Finalidade: auxílio na redação e pesquisa documental. Base legal: interesse legítimo do empregador. Dados tratados: conteúdo das conversas, identificador SSO.
Prazo de retenção
Defina uma política clara: 90 dias de histórico de conversas por usuário, com exclusão automática após esse prazo. Documente-a na carta de princípios.
Informação aos colaboradores
Atualização da política de uso dos recursos de TI e da nota informativa CSE/CSE. Mencione explicitamente que as conversas são armazenadas e podem ser acessadas pelo administrador técnico em caso de incidente.
AI Act
Um assistente de chat interno de produtividade cai na categoria "risco limitado" (artigo 50). Obrigação principal: informar o usuário que está interagindo com uma IA — a interface Open WebUI faz isso por padrão.
Segurança técnica
Backups criptografados do banco de dados do Open WebUI, acesso administrativo registrado, MFA obrigatório nas contas Entra ID, atualização mensal das imagens Docker.
i
DPIA necessária?
Uma análise de impacto (DPIA) não é obrigatória para um uso padrão de produtividade, mas é recomendada se você planeja conectar o RAG a dados sensíveis (arquivos de RH, dados de clientes identificáveis). Em caso de dúvida, o seu DPO decide.

#7. ROI: cálculo honesto

Vamos considerar uma PME com 30 colaboradores, com implantação do Perfil A por 5.000 €. Em um horizonte de 3 anos.

Custo da alternativa SaaS
30 × 25 € × 12 meses × 3 anos = 27.000 € (ChatGPT Team).
Custo interno
Workstation de 5 000 € + eletricidade ~200 €/ano + 5 dias-homem de instalação no 1º ano (~3 500 €) + 2 dias-homem/ano de manutenção (~1 400 €/ano × 2 anos) = ~11 500 € em 3 anos.
Economia líquida direta
~15 500 € ao longo de 3 anos, ou aproximadamente 5 200 € por ano a partir do ano 2.
Ganhos indiretos
Redução do risco de vazamento de dados (quantificável ao considerar que um único vazamento evitado cobre com folga o custo do projeto), conformidade com o RGPD facilitada, independência em relação aos aumentos de preços dos serviços SaaS.
Aumento da produtividade
Estimativa prudente: 15 minutos economizados por usuário e por dia útil. Com um custo de 35 €/h incluindo encargos e considerando 220 dias, isso equivale a cerca de 38.500 € por ano para 30 pessoas. Esse valor depende fortemente da adoção real — seja cauteloso ao elaborar estudos de viabilidade econômica.
!
Erro clássico do ROI de produtividade
Contar com 1 hora economizada por dia e multiplicar — isso está errado. A maioria dos usuários regulares economiza de 10 a 20 minutos por dia, e 40% das contas ficam inativas após 2 meses. Seja generoso na estimativa de adoção (50–60%) e conservador no ganho por usuário (15 min). O ROI continua bastante positivo.

#Para se aprofundar

Este guia estabelece a base. Três caminhos naturais a seguir: adicionar um RAG robusto sobre seus documentos internos para que o chatbot conheça seus procedimentos, reforçar a segurança da implantação multiusuário na intranet e formalizar a conformidade com o RGPD com um dossiê bem organizado.

Os preços mudam rápido: nosso monitoramento registra toda segunda e quinta-feira o menor preço das placas de vídeo para IA local, com o preço por GB de VRAM.

Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.