Tudo sobre o Granite Guardian da IBM para conformidade IA
Granite Guardian é o classificador de segurança da IBM: um modelo pequeno cujo único trabalho é ler uma entrada ou saída de um LLM e responder “arriscado” ou “seguro”. A versão 4.1 (abril de 2026, licença Apache 2.0) roda inteiramente em ambiente local via Ollama e abrange os riscos próprios dos agentes — jailbreaks, chamadas de ferramentas alucinadas, respostas RAG sem fundamento. Este guia mostra como instalá-lo, chamá-lo e colocá-lo como uma camada de proteção antes dos seus agentes locais, sem nunca enviar um prompt para a nuvem.
#Por que usar uma proteção local para seus agentes
Um LLM que responde em um chat é fácil de monitorar: você lê a resposta. Já um agente encadeia chamadas de ferramentas, lê documentos RAG e toma decisões sem que ninguém revise cada etapa. É exatamente aí que os incidentes acontecem: um prompt injetado em um documento desencadeia uma ação indesejada, uma chamada de ferramenta é inteiramente inventada, uma resposta “factual” é, na realidade, uma alucinação. Você precisa de um componente que inspecione esse fluxo continuamente.
O reflexo habitual é chamar uma API de moderação em nuvem (OpenAI Moderation, Azure Content Safety). Problema: você escolheu justamente o local para que seus prompts e seus dados não saiam. Enviar cada mensagem para um serviço de moderação remoto anula todo o benefício da confidencialidade. O Granite Guardian resolve esse paradoxo — é um filtro que roda ao lado dos seus modelos, na mesma máquina.
#Granite Guardian: o que é exatamente?
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
Granite Guardian pertence à família Granite da IBM. É um classificador de segurança treinado para detectar conteúdos problemáticos nas entradas e saídas de LLMs. A versão 4.1 (abril de 2026) é publicada sob a licença Apache 2.0, o que permite o uso comercial e a modificação sem pagamento de royalties — um ponto fundamental para a implantação em empresas.
- Função
- Detector, não gerador. Recebe um texto e retorna um sinal de risco (yes/no + pontuação de probabilidade).
- Tamanhos
- Uma variante compacta (~2B) para a latência, uma variante maior (~8B) para a precisão. A versão de 2B é suficiente para a maioria dos mecanismos de proteção on-line.
- Licença
- Apache 2.0 — uso comercial, redistribuição e fine-tuning autorizados
- Especialidade 4.1
- Riscos relacionados a agentes: detecção de chamadas de ferramentas alucinadas e verificação de que as respostas RAG estão devidamente fundamentadas no contexto fornecido.
- Formato
- Um prompt estruturado indica o tipo de risco a ser avaliado; o modelo responde com um veredito que você processa por parsing.
#Os riscos que o Granite Guardian detecta
O modelo abrange duas grandes famílias. Primeiro, os riscos “clássicos” de conteúdo; depois, os riscos próprios dos sistemas baseados em agentes e RAG — é aí que a versão 4.1 se destaca.
- Jailbreak / injeção
- Tentativas de contornar as instruções do sistema, incluindo injeções ocultas em um documento ou em uma página web lida pelo agente.
- Conteúdo prejudicial
- Violência, conteúdo sexual, incitação a atos perigosos, discurso de ódio — tanto na entrada quanto na saída.
- Groundedness (RAG)
- A resposta é realmente sustentada pelos documentos recuperados ou o modelo inventou? Detecta alucinações em RAG.
- Relevância do contexto
- Os trechos recuperados estão realmente relacionados à pergunta? Um contexto fora do tema é um sinal de deriva do retriever.
- Alucinação em chamadas de função
- O agente chama uma ferramenta que não existe ou com argumentos incoerentes em relação à solicitação do usuário?
#Pré-requisitos
Granite Guardian roda ao lado do seu modelo principal, então é necessário reservar sua VRAM além da do agente. A boa notícia: a versão 2B é leve.
- Ollama instalado
- O daemon escuta por padrão em http://localhost:11434. Ver o guia de instalação do Ollama se você ainda não o instalou.
- VRAM (Guardian 2B, Q4_K_M)
- ≈ 2 GB. Ele se soma ao seu modelo de agente. Uma RTX 3060 12GB comporta sem problemas um 7B mais o Guardian.
- VRAM (Guardian 8B, Q4_K_M)
- ≈ 5 GB, se quiser a variante mais refinada e tiver margem (RTX 4080 16GB, M4 Pro).
- Quantization
- Q4_K_M recomendado para equilíbrio entre latência e qualidade. Q8_0 se você tiver margem e quiser limitar a perda na decisão de risco.
#Instalar o modelo
- 01Verificar se o Ollama está em execuçãoUm `ollama list` deve responder sem erro. Caso contrário, inicie o daemon (`ollama serve` no Linux, ou a aplicação no Windows/macOS).
- 02Obter a tag oficialProcure « granite-guardian » no ollama.com/library e anote a tag exata da variante 2B. Os nomes das tags mudam de versão para versão; não tente adivinhá-los.
- 03Baixar o modeloUm simples `ollama pull` baixa os pesos quantizados em formato GGUF. Espere um download de 1 a 2 GB para a versão 2B.
- 04ConfirmarExecute `ollama list` novamente: o modelo deve aparecer com seu tamanho. Você está pronto para fazer perguntas a ele.
#Primeira chamada ao mecanismo de proteção
O princípio: você envia ao Guardian o texto a ser avaliado, especificando o tipo de risco. O modelo retorna uma decisão que você interpreta. A forma mais simples é usar a API compatível com a OpenAI do Ollama, no mesmo endpoint local.
#Proteger um agente: chamadas de ferramenta e RAG
A verdadeira utilidade da versão 4.1 aparece quando você supervisiona um agente. O Guardian é colocado em três pontos: antes que o agente receba a entrada (jailbreak/injeção), após uma recuperação RAG (groundedness) e antes de executar uma chamada de ferramenta (alucinação de função).
- 01Filtrar a entradaCada mensagem do usuário — e cada documento externo lido pelo agente — passa primeiro pelo Guardian em modo jailbreak/injeção. Um documento da web com uma armadilha é interceptado antes de chegar ao modelo principal.
- 02Verificar o grounding RAGApós a recuperação dos trechos, envie ao Guardian a pergunta, os trechos e a resposta candidata no modo groundedness. Se ele julgar a resposta não fundamentada, rejeite-a ou acione uma nova recuperação.
- 03Validar o tool-callAntes de executar uma chamada de ferramenta, solicite uma avaliação da coerência entre a solicitação do usuário e a ferramenta invocada. Uma chamada alucinada (ferramenta inexistente, argumentos incoerentes) é bloqueada antes de qualquer efeito colateral.
#Casos de uso relacionados ao RGPD e à conformidade
Executar a moderação localmente não é apenas uma comodidade técnica: é um argumento de conformidade. Sob o RGPD e a Lei da IA, cada transferência de dados pessoais para um serviço de terceiros deve ser justificada, submetida a regras e documentada. Uma salvaguarda na nuvem obrigaria você a enviar prompts — potencialmente repletos de dados pessoais — a um subcontratado adicional.
- Zero transferência de dados
- O texto avaliado nunca sai da sua infraestrutura. Não há prestador de moderação a incluir no registro das atividades de tratamento nem a regular por meio de um DPA.
- Rastreabilidade
- Você registra localmente cada resultado da avaliação (risco detectado, tipo, pontuação). Útil para demonstrar supervisão efetiva dos sistemas de risco nos termos da Lei de IA (AI Act).
- Minimização
- O Guardian bloqueia previamente entradas maliciosas capazes de exfiltrar dados por meio do agente, o que reduz a exposição a incidentes.
- Soberania
- Modelo Apache 2.0 executado em hardware que você controla: sem dependência da disponibilidade ou das condições de um fornecedor externo.
#Solução de problemas e dicas
- Veredito sempre igual
- Se tudo retornar “no”, verifique se o tipo de risco foi passado corretamente (no papel system) e se a tag do modelo está correta. Um modelo genérico não fará o trabalho de um Guardian.
- Latência muito alta
- Mude da versão 8B para a 2B, aplique quantização em Q4_K_M e mantenha o modelo carregado (keep-alive do Ollama) para evitar o recarregamento a cada chamada.
- Parsing frágil
- Não assuma o formato. Registre a saída bruta por alguns dias em pré-produção, depois escreva um parser tolerante (minúsculas, trim, prefixo).
- Dois modelos em VRAM
- Guardian + agente precisam caber juntos na VRAM. Em uma placa de 12 GB, fique com um agente 7B Q4 + Guardian 2B Q4 (~7 GB no total).
- Falsos positivos problemáticos
- Ajuste o tipo de risco avaliado de acordo com seu uso real, em vez de ativar todos os detectores. Um filtro excessivamente rigoroso acaba sendo desativado pelas equipes.
#Para se aprofundar
Granite Guardian integra uma abordagem mais ampla de privacidade e conformidade em execução local. Três guias complementam esse quadro: a checklist de privacidade para verificar que nada vaza da sua máquina, o guia LLM local e RGPD para o enquadramento legal completo, e o guia de IA local em empresas para organizar uma implantação em conformidade.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.