Modelos abliterated (não censurados) executados localmente: guia pratique
Modelos open-weight como Qwen, Gemma ou Mistral foram alinhados para recusar determinadas solicitações. Um modelo abliterated é uma variante em que esse comportamento de recusa foi removido cirurgicamente no nível dos pesos — não por meio de um prompt de jailbreak, mas editando a rede. Este guia explica o que essa técnica realmente faz, onde encontrar esses modelos, como executá-los localmente com Ollama ou em GGUF e quais são os limites reais.
#O que é um modelo abliterated
Um modelo chamado « abliterated » (às vezes « decensored » ou « uncensored ») é um LLM de pesos abertos do qual foi removida a capacidade de recusar. Quando você pede algo que um Qwen 3.5 padrão recusaria com « I cannot help with that », a versão abliterated responde diretamente, sem mensagem de alinhamento, sem preâmbulo moralizador, sem desviar da pergunta.
Importante: isso não é um jailbreak por prompt. O modelo foi modificado no nível de seus pesos. A recusa tornou-se mecanicamente impossível — ou, pelo menos, extremamente rara — porque a direção interna que a desencadeava foi removida.
#Como funciona a ablação
Você agora sabe o que é um modelo « abliterated ». O kit IA Sem Filtros começa pelo contexto legal na França e na Europa (cap. 4), depois ensina você a avaliar uma variante antes de baixá-la (cap. 5 e 6) e a escolher aquela que cabe na sua memória de vídeo (cap. 7).
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
A ablação se baseia em um resultado publicado em 2024 por Arditi et al. (« Refusal in Language Models Is Mediated by a Single Direction »). Os autores mostram que, na maioria dos LLMs alinhados, a recusa é controlada por uma única direção no espaço das ativações internas — um vetor que pode ser isolado comparando as ativações em prompts inofensivos e em prompts que provocam uma recusa.
A ablação consiste em remover essa direção dos pesos do modelo por meio de projeção, camada por camada. Concretamente, modificam-se as matrizes de projeção para que elas não possam mais produzir a componente associada à recusa. O modelo continua funcionando normalmente, mas o “sinal interno” que o fazia passar para o modo “eu me recuso” foi cortado.
- Etapa 1 — Sondar
- Enviamos dezenas de pares de prompts para o modelo: prompts neutros e prompts que levam o modelo a recusar. Registramos as ativações em cada camada.
- Etapa 2 — Isolar
- Calcula-se a diferença média das ativações entre os dois grupos. Esse vetor, normalizado, é a direção de recusa.
- Etapa 3 — Projetar
- Modificamos os pesos de cada camada para tornar essa direção inacessível. É apenas uma subtração de uma projeção ortogonal, não um retreinamento.
- Etapa 4 — Testar
- Verificamos se o modelo deixou de recusar respostas e se suas capacidades gerais (raciocínio, código, francês) não despencaram.
#Onde encontrar modelos abliterated
A maior parte do ecossistema está no Hugging Face. Alguns publicadores são referências na comunidade pela qualidade de suas ablações:
- mlabonne
- Maxime Labonne, um dos primeiros a popularizar a técnica. Variantes abliterated de Qwen 3.5, Gemma 4 e Mistral Small — todas documentadas em huggingface.co/mlabonne.
- huihui-ai
- Cobre uma gama muito ampla: Qwen 3.5 (2B a 27B), Granite 4.2, Gemma 4, GLM 4.7. Variantes indicadas como « -abliterated » ou « -abliterate ».
- failspy
- Autor de várias variantes de destaque (Qwen 3.5 9B abliterated, Gemma 4 12B abliterated). Muito comentado quanto à qualidade.
- Orenguteng / Lexi
- A série « Lexi-Uncensored » combina ablação e fine-tuning leve. Conhecida por seu tom conversacional.
Para usar com Ollama, o registro oficial também hospeda diversas variantes — busque tags contendo abliterated ou uncensored em ollama.com/library, ou use as variantes comunitárias publicadas por huihui_ai e mlabonne, que podem ser baixadas diretamente com pull.
#Instalação no Ollama
A maneira mais simples de rodar um LLM abliterated localmente é usar o Ollama. O daemon escuta por padrão em http://localhost:11434 e aceita as variantes da comunidade sem configuração especial.
- 01Verificar se o Ollama está em execuçãoExecutar ollama --version em um terminal. Se o comando falhar, seguir o guia de instalação do Ollama antes de continuar.
- 02Escolher um modelo adequado à sua VRAMRetome as estimativas: um modelo 7-8B Q4 ocupa ~5 GB, um 14B ~9 GB, um 32B ~19 GB, um 70B ~40 GB. Uma RTX 3060 de 12 GB é suficiente para rodar um modelo 8B com conforto, enquanto uma RTX 4090 de 24 GB permite o uso de modelos 32B.
- 03Pull e runUse ollama run com o nome completo da variante. O modelo é baixado e depois carregado na VRAM, e a conversa começa.
- 04Testar uma recusa típicaFaça uma pergunta que o modelo base recusaria. Se a variante tiver passado corretamente pelo processo de abliteration, você obtém uma resposta direta, sem preâmbulo.
Após o modelo ser carregado, seu funcionamento passa a ser o de qualquer outro LLM no Ollama: endpoint compatível com a OpenAI em :11434, integrável ao Open WebUI, Continue.dev, LiteLLM e aos seus scripts Python. Nenhuma opção especial é necessária para que um modelo abliterated « funcione » — a ausência de recusas está nos pesos, não na configuração.
#Com GGUF (LM Studio, llama.cpp)
Se você preferir LM Studio ou llama.cpp diretamente, trabalhará com arquivos GGUF. A maioria das ablações já está disponível em várias quantizações no Hugging Face — Q4_K_M continua sendo o equilíbrio recomendado (qualidade preservada, VRAM mínima), Q5_K_M se você tiver margem, Q8_0 se quiser a fidelidade máxima.
- 01Identificar o repositório GGUFNo Hugging Face, procure os repositórios com o rótulo -GGUF. Por exemplo: mlabonne/Qwen3.5-9B-abliterated-GGUF ou bartowski/<modelo>-abliterated-GGUF.
- 02Baixar a quantização corretaNo LM Studio, a interface permite filtrar por tamanho e por responsável pela publicação. Prefira Q4_K_M na maioria dos casos. Para modelos muito pequenos (1-3B), Q5_K_M ou Q6_K evita uma perda significativa.
- 03Carregar e testarLM Studio carrega automaticamente as camadas na GPU se a VRAM for suficiente. Monitore o indicador de offload — se parte do modelo passar a usar a RAM, a velocidade cai.
- 04Expor pela APIAtive o servidor local compatível com OpenAI se quiser conectá-lo aos seus apps. A porta padrão é 1234 para LM Studio (contra 11434 para Ollama).
#Limitações e perda de qualidade
A ablação tem um custo. Remover uma direção no resíduo altera tudo o que passava por essa direção, incluindo componentes úteis. Efeitos colaterais observados na prática:
- Leve queda nos benchmarks de raciocínio
- Normalmente, observa-se uma queda de 1 a 3 pontos em MMLU ou GSM8K. É mensurável, mas raramente é um impedimento no uso real.
- Respostas às vezes mais mecânicas
- O modelo perde parte da nuance de alinhamento: menos pedidos de esclarecimento, menos advertências mesmo quando seriam úteis.
- Alucinações apenas um pouco mais frequentes
- Em perguntas para as quais o modelo normalmente teria respondido « não tenho certeza », ele tende a inventar uma resposta confiante.
- Comportamentos residuais
- Algumas recusas ainda ocorrem, especialmente quando as ablações são aproximadas. Por outro lado, alguns modelos muito bem abliterated respondem a tudo — inclusive a coisas sobre as quais você preferiria que eles ficassem em silêncio.
#Riscos e uso responsável
Um modelo que já não recusa nada não é um brinquedo. Alguns princípios simples antes de integrá-lo a um uso real:
- Você continua responsável pelas saídas
- Quer você use um modelo alinhado, abliterated ou na nuvem, é você quem decide como utiliza as respostas. O RGPD, o direito penal e os direitos autorais não mudam conforme a versão do modelo.
- Não o disponibilize para uso livre sem filtros
- Se você montar um endpoint para uma equipe, preveja pelo menos uma filtragem no lado da aplicação (palavras-chave, moderação de saída). Um modelo abliterated sem filtros adicionais em um chat interno é uma má ideia por padrão.
- Seja transparente com os usuários
- Se um aplicativo conectado a um modelo abliterated gerar conteúdo que possa surpreender, avise seus usuários. Sem surpresas, sem processos.
- Uso legítimo, uso real
- Pesquisa em segurança da IA, red-teaming, processamento de corpus sensíveis (médicos, jurídicos, de segurança) em que as recusas de um modelo alinhado tornam a ferramenta inutilizável: esses são os casos em que a ablação tem valor real. A postura de « removi a censura por diversão » expõe você a respostas muito indesejáveis, sem benefício.
#Dicas e solução de problemas
- Mesmo assim, o modelo recusa
- Algumas ablações ainda deixam passar recusas em temas específicos (política, medicina, menores). Tente outra ablação do mesmo modelo ou uma versão publicada por outro responsável — a qualidade da ablação varia bastante.
- O modelo ficou incoerente
- Sintoma de uma ablação excessivamente agressiva (direções demais removidas ou uma direção mal isolada). Prefira uma variante de um publicador reconhecido em vez de uma ablação feita por conta própria e não documentada.
- Desempenho ruim em francês
- Como em qualquer modelo de pesos abertos, o desempenho em francês depende do modelo de base. Qwen 3.5, Mistral Small, Gemma 4 e Granite 4.2 são sólidos; os modelos mais antigos (Llama 3, Phi-3, Gemma 2) são mais fracos. A ablação não muda isso.
- Preâmbulos residuais do tipo “As an AI, I cannot...”
- Em vez de um jailbreak, adicione um prompt de sistema curto que relembre o papel e o formato esperado. Isso costuma ser suficiente para eliminar os resquícios de alinhamento.
- VRAM saturada
- Com 8 GB, fique com um modelo de 7–8B em Q4_K_M. Com 12 GB, você pode subir para Q5_K_M ou tentar um 14B em Q4. Com 24 GB, um modelo de 32B em Q4 roda com folga.
#Para se aprofundar
A ablação é uma porta de entrada para a personalização de modelos open-weight. Para ir além:
- Personalizar um modelo com Ollama Modelfile
- Se você quer adicionar uma camada de personalização com prompt de sistema, parâmetros e template a uma variante abliterated, o Modelfile é a ferramenta que precisa conhecer.
- Escolher sua quantização (Q4, Q5, Q8, FP16)
- Para entender qual GGUF carregar com base na sua VRAM e na qualidade desejada — a ablação não altera os compromissos envolvidos nessa escolha.
- Fine-tuning local de LLMs: LoRA e QLoRA
- Se a ablação sozinha não for suficiente e você quiser ajustar o tom ou o domínio, um LoRA leve em uma variante abliterated geralmente é o melhor equilíbrio.
Existe uma IA sem limites nem censura?+
Uma IA sem censura executada localmente é legal?+
Uma IA local sem limites é menos inteligente?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.