SillyTavern: a interface de personagens para LLM local
O SillyTavern é uma interface web pensada para interpretação de papéis e escrita interativa com um LLM. Ela não executa modelos por si só: conecta-se a um backend local como o KoboldCpp ou o Ollama e acrescenta tudo o que falta ao chat tradicional — cartões de personagens, memória persistente do mundo, controle detalhado do prompt e extensões. Este guia abrange a instalação, a conexão com seu backend, a criação de personagens e as configurações que fazem a diferença na interpretação de personagens.
#Por que SillyTavern em vez de um chat clássico
Uma interface como Open WebUI ou LM Studio trata cada conversa como uma troca entre assistente e usuário. O SillyTavern parte de outra necessidade: interpretar um personagem coerente ao longo de centenas de mensagens, em um universo que se lembra de suas próprias regras. É a ferramenta de referência da comunidade de RPG com LLM local e traz mecânicas que o chat básico não possui.
- Cartões de personagens
- Um formato padronizado (PNG com metadados incorporados) que descreve persona, estilo, exemplos de diálogo e mensagem de boas-vindas. Importável e compartilhável em um único arquivo.
- Memória do mundo
- O lorebook injeta informações no prompt apenas quando uma palavra-chave aparece, o que mantém um universo coerente sem saturar o contexto.
- Controle do prompt
- Você vê e modifica cada bloco enviado ao modelo: prompt de sistema, formato de instrução, ordem de injeção. Nada está escondido.
- Backend à sua escolha
- SillyTavern é um front-end puro. O mesmo personagem roda em KoboldCpp, Ollama, llama.cpp ou uma API remota sem precisar reescrever nada.
#Pré-requisitos e escolha do backend
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
SillyTavern roda em Node.js (versão 18 ou superior) no Windows, macOS e Linux. É leve em termos de recursos — é o backend que consome a VRAM. Dois backends locais cobrem quase todos os usos: KoboldCpp, voltado para GGUF e interpretação de personagens, e Ollama, mais generalista.
- KoboldCpp
- Binário único que executa arquivos GGUF com uma API que o SillyTavern suporta nativamente. Ajustes finos de memória, suporte a AMD ROCm. A escolha padrão da comunidade RP.
- Ollama
- O daemon escuta em http://localhost:11434. Prático se você já o usa para outra coisa; o SillyTavern se conecta a ele por meio do endpoint compatível do daemon.
- llama.cpp (llama-server)
- Servidor HTTP compatível com OpenAI para controle máximo do offloading das camadas.
- VRAM
- Em Q4_K_M: um modelo de 7B cabe em ~5 GB, um de 14B em ~9 GB e um de 32B em ~19 GB. Para um RP fluido, busque um modelo de pelo menos 12-14B se a sua placa permitir.
#Instalar o SillyTavern
O método recomendado é a clonagem com Git: ela torna as atualizações triviais (um git pull), e o SillyTavern evolui rapidamente. Certifique-se de ter o Node.js 18+ e o Git instalados.
- 01Clonar o repositórioBaixe a branch release, estável e testada. Evite a branch staging, a menos que queira acesso antecipado às novidades ao custo de alguns bugs.
- 02Iniciar o script de inicializaçãostart.sh no Linux/macOS, Start.bat no Windows. Na primeira execução, o npm instala as dependências automaticamente.
- 03Abrir a interfaceO SillyTavern disponibiliza sua interface em http://localhost:8000. Abra esse endereço no seu navegador; não é necessário instalar nenhum aplicativo de desktop.
- 04Atualizar mais tardeFaça um git pull no diretório e reinicie o script. Seus personagens e conversas estão armazenados separadamente em data/ e não serão sobrescritos.
#Conectar o backend local
Depois de abrir o SillyTavern, tudo acontece na aba de conexão com a API (o ícone em forma de tomada na parte superior). O princípio: iniciar o backend de um lado e informar seu endereço ao SillyTavern do outro.
#Com KoboldCpp
Inicie o KoboldCpp com seu modelo GGUF; ele expõe sua API na porta 5001 por padrão. No SillyTavern, escolha o tipo de API « Text Completion » e o backend « KoboldCpp », depois insira a URL. Clique em Connect: o nome do modelo carregado será exibido se tudo estiver certo.
#Com Ollama
Ollama já está rodando como daemon na porta 11434. No SillyTavern, selecione « Text Completion » e depois o backend « Ollama », insira o endereço e escolha o modelo na lista suspensa carregada automaticamente.
#Criar e importar cartões de personagens
O cartão de personagem é o coração do SillyTavern. Trata-se de um arquivo PNG cuja imagem serve de avatar e cujos metadados incorporados descrevem o personagem. Você pode criar um do zero ou importar um cartão compartilhado pela comunidade.
#Os campos que importam
- Descrição
- A base do personagem: aparência, traços, histórico. Essas informações são inseridas permanentemente no contexto, então concentre as informações e seja concreto, sem se alongar.
- Personality
- Um resumo do temperamento. Útil para orientar o tom sem precisar reescrever toda a descrição.
- First message
- A mensagem de boas-vindas que estabelece a cena. Ela define o tom, o estilo de escrita e o formato esperado — o modelo tende a imitar sua estrutura.
- Example dialogues
- Exemplos de frases que mostram ao modelo como o personagem fala. Muito eficaz para fixar uma voz específica.
- Scenario
- O contexto da cena, separado da descrição do personagem. Útil para reutilizar o mesmo personagem em várias situações.
- 01Abrir o painel de personagensO ícone de personagem na barra superior abre a lista. O botão “+” cria uma ficha em branco.
- 02Preencher a descriçãoDescreva o personagem com bastante informação em pouco espaço. Muitos autores usam um formato estruturado (listas de características) em vez de um parágrafo, formato que os modelos seguem bem.
- 03Escrever a primeira mensagemCapriche nele: é a sua melhor ferramenta para definir o estilo. Uma mensagem de boas-vindas narrativa em terceira pessoa direciona o modelo para esse formato.
- 04Importar um cartão existenteArraste um arquivo PNG de cartão para a lista ou importe-o. Os cartões são compartilhados como simples arquivos de imagem nos hubs comunitários.
#Mundo persistente: o lorebook
O lorebook (ou World Info) resolve o problema central das partidas longas: como manter um universo coerente sem injetar tudo o tempo todo. O princípio é a injeção condicional por palavras-chave.
Você cria entradas, cada uma associada a um ou mais termos-chave. Quando um desses termos aparece nas mensagens recentes, a entrada correspondente é injetada no contexto imediatamente antes da geração. No restante do tempo, ela não ocupa nenhum espaço. Assim, você pode descrever dezenas de locais, personagens secundários e regras sem nunca saturar o prompt.
- Entrada
- Um bloco de texto (o lore a ser inserido) e as palavras-chave que o acionam. Exemplo: palavra-chave “Valmont” → descrição da cidade de Valmont.
- Constante versus seletivo
- Uma entrada pode sempre estar ativa (regras fundamentais do universo) ou ser acionada apenas por palavra-chave (detalhes contextuais).
- Profundidade de injeção
- Você escolhe a posição em que a entrada é inserida no prompt, o que influencia o peso que o modelo dá a ela.
- Relacionado ao personagem ou global
- Um lorebook pode acompanhar uma ficha de personagem específica ou se aplicar a todas as suas conversas como um universo compartilhado.
#Ajustar a geração para interpretar personagens
Os parâmetros de amostragem determinam o equilíbrio entre coerência e criatividade. Para interpretação de papéis, busca-se mais variedade do que para assistência factual, sem cair na incoerência. Esses ajustes estão na aba de parâmetros de geração (ícone dos controles deslizantes).
- Temperatura
- O controle de criatividade/estabilidade. Em torno de 0,7 a 0,9 para um bom equilíbrio em roleplay (RP). Um valor alto demais (> 1,2) leva à incoerência; um valor baixo demais torna o personagem repetitivo e sem profundidade.
- Min-P
- Um sampler moderno que elimina os tokens improváveis proporcionalmente ao mais provável. Um valor de 0,05 a 0,1 melhora a qualidade da saída e permite aumentar a temperatura sem perder a coerência.
- Penalidade de repetição
- Penaliza a repetição dos mesmos tokens. É útil para evitar loops, mas, se a penalidade for muito alta, força o modelo a usar construções artificiais. Use com moderação.
- Response length
- O número máximo de tokens gerados por resposta. 200-400 tokens para respostas narrativas substanciais sem monólogos intermináveis.
- Context size
- Deve corresponder ao que seu backend carregou. Não adianta pedir 16k ao SillyTavern se o KoboldCpp foi iniciado apenas com 8k.
#As extensões que mudam a experiência
SillyTavern é extensível. Algumas extensões já vêm incluídas, outras são instaladas pela URL de seus repositórios. Estas são as que realmente transformam o uso.
- Vector Storage (resumo da memória)
- Vetoriza o histórico e reinjeta trechos relevantes de mensagens antigas, estendendo a memória além da janela de contexto. Útil para partidas muito longas.
- Summarize
- Gera e mantém um resumo atualizado da conversa, reinserido no prompt. O personagem se lembra dos grandes acontecimentos mesmo após centenas de mensagens.
- Text-to-Speech
- Dá voz aos personagens por meio de um motor TTS local. Imersão aprimorada para quem joga por voz.
- Geração de imagem
- Conecta-se a um backend local de imagens (como o Stable Diffusion) para ilustrar cenas e personagens em tempo real a partir do chat.
- Expressões
- Exibe o avatar com uma emoção correspondente ao tom da mensagem, a partir de um conjunto de sprites do personagem.
#Quais modelos locais se destacam na interpretação de personagens
Nem todos os LLMs têm o mesmo desempenho na interpretação de personagens. Os modelos « instruct » alinhados para assistência tendem a sair do personagem, dar lições de moral ou recusar cenários de ficção. A comunidade prefere modelos com ajuste fino especializado, muitas vezes construídos sobre bases sólidas e depois retreinados para a narrativa e o diálogo no papel de um personagem.
- Tamanho útil
- Abaixo de 4B, a coerência do personagem ao longo do tempo fica prejudicada. Em 2026, uma base recente como Qwen 3.5 9B (~6,6 GB, 256k de contexto) ou Gemma 4 12B (~7,6 GB, Apache 2.0) é o ponto de equilíbrio para a maioria das placas de vídeo de faixa intermediária; um nível acima, Mistral Small 24B (~14 GB, muito competente em francês) cabe em 16 GB e oferece maior refinamento narrativo.
- Ajustes finos de RP
- Procure modelos explicitamente treinados para roleplay ou ficção (muitas vezes indicados como « RP », « storytelling » ou « uncensored » no Hugging Face). Os melhores fine-tunes de 2026 são construídos sobre essas bases recentes (Qwen 3.5, Mistral Small 24B, Gemma 4) em vez dos antigos Llama 2 ou Mistral 7B de 2023; eles seguem melhor o formato das fichas.
- Contexto longo
- Prefira um modelo que se mantenha estável com 16k+ tokens sem degradar: sessões longas exigem isso. Verifique o tamanho de contexto nativo anunciado para o modelo.
- Formato GGUF
- Para o KoboldCpp, continue usando modelos GGUF quantizados. Q4_K_M é o compromisso recomendado; passe para Q5_K_M ou Q8_0 se sua VRAM permitir e você quiser mais refinamento.
#Solução de problemas comuns
- SillyTavern não se conecta
- Verifique se o backend está funcionando bem e se a porta está correta (5001 para KoboldCpp, 11434 para Ollama). Um teste no navegador na URL da API confirma que ela responde.
- Respostas com tags visíveis
- Quase sempre um template de instrução inadequado. Alinhe o formato (ChatML, Gemma, Mistral…) ao do modelo em Advanced Formatting.
- O personagem sai do seu papel
- Aprimore a descrição e os exemplos de diálogo, abaixe um pouco a temperatura e verifique se seu prompt de sistema não entra em conflito com a ficha do personagem.
- Repetições e laços
- Aumente levemente a penalidade de repetição e adicione um Min-P. Se o problema persistir, o contexto pode estar saturado: ative Summarize ou reduza o tamanho da ficha do personagem.
- Respostas truncadas
- Response length muito baixo, ou o backend foi iniciado com um contexto menor do que o solicitado pelo SillyTavern. Alinhe os dois valores.
#Para se aprofundar
O SillyTavern é apenas uma camada: a qualidade final depende principalmente do seu backend e do modelo. Esses guias ajudam a fortalecer as bases.
- KoboldCpp: instalação e início rápido
- O backend de referência para o RP local: GGUF, configurações de memória e uma API com suporte nativo no SillyTavern.
- O que é o Ollama e como funciona
- A alternativa generalista se você prefere um único daemon na porta 11434 para todos os seus usos.
- Quantificar o cache KV
- Para manter contextos de roleplay (RP) mais longos na mesma placa de vídeo sem consumir VRAM em excesso.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.