Intermediário 12 minInterfaces

SillyTavern: a interface de personagens para LLM local

O SillyTavern é uma interface web pensada para interpretação de papéis e escrita interativa com um LLM. Ela não executa modelos por si só: conecta-se a um backend local como o KoboldCpp ou o Ollama e acrescenta tudo o que falta ao chat tradicional — cartões de personagens, memória persistente do mundo, controle detalhado do prompt e extensões. Este guia abrange a instalação, a conexão com seu backend, a criação de personagens e as configurações que fazem a diferença na interpretação de personagens.

Por Léa B.·Atualização 2026-08-27·Testado no Windows, macOS e Linux

#Por que SillyTavern em vez de um chat clássico

Uma interface como Open WebUI ou LM Studio trata cada conversa como uma troca entre assistente e usuário. O SillyTavern parte de outra necessidade: interpretar um personagem coerente ao longo de centenas de mensagens, em um universo que se lembra de suas próprias regras. É a ferramenta de referência da comunidade de RPG com LLM local e traz mecânicas que o chat básico não possui.

Cartões de personagens
Um formato padronizado (PNG com metadados incorporados) que descreve persona, estilo, exemplos de diálogo e mensagem de boas-vindas. Importável e compartilhável em um único arquivo.
Memória do mundo
O lorebook injeta informações no prompt apenas quando uma palavra-chave aparece, o que mantém um universo coerente sem saturar o contexto.
Controle do prompt
Você vê e modifica cada bloco enviado ao modelo: prompt de sistema, formato de instrução, ordem de injeção. Nada está escondido.
Backend à sua escolha
SillyTavern é um front-end puro. O mesmo personagem roda em KoboldCpp, Ollama, llama.cpp ou uma API remota sem precisar reescrever nada.
i
SillyTavern não substitui o seu servidor de inferência
É uma camada de interface. Você sempre precisará de um backend que carregue o modelo e execute a geração. O SillyTavern se limita a orquestrar o prompt e exibir o resultado.

#Pré-requisitos e escolha do backend

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

SillyTavern roda em Node.js (versão 18 ou superior) no Windows, macOS e Linux. É leve em termos de recursos — é o backend que consome a VRAM. Dois backends locais cobrem quase todos os usos: KoboldCpp, voltado para GGUF e interpretação de personagens, e Ollama, mais generalista.

KoboldCpp
Binário único que executa arquivos GGUF com uma API que o SillyTavern suporta nativamente. Ajustes finos de memória, suporte a AMD ROCm. A escolha padrão da comunidade RP.
Ollama
O daemon escuta em http://localhost:11434. Prático se você já o usa para outra coisa; o SillyTavern se conecta a ele por meio do endpoint compatível do daemon.
llama.cpp (llama-server)
Servidor HTTP compatível com OpenAI para controle máximo do offloading das camadas.
VRAM
Em Q4_K_M: um modelo de 7B cabe em ~5 GB, um de 14B em ~9 GB e um de 32B em ~19 GB. Para um RP fluido, busque um modelo de pelo menos 12-14B se a sua placa permitir.
→
Contexto longo = mais VRAM
A interpretação de personagens depende de contextos longos (8k, 16k, 32k tokens). O cache KV aumenta com o contexto e consome VRAM além dos pesos. Reserve margem ou quantize o cache KV para acomodar um contexto maior na mesma placa.

#Instalar o SillyTavern

O método recomendado é a clonagem com Git: ela torna as atualizações triviais (um git pull), e o SillyTavern evolui rapidamente. Certifique-se de ter o Node.js 18+ e o Git instalados.

  1. 01
    Clonar o repositório
    Baixe a branch release, estável e testada. Evite a branch staging, a menos que queira acesso antecipado às novidades ao custo de alguns bugs.
  2. 02
    Iniciar o script de inicialização
    start.sh no Linux/macOS, Start.bat no Windows. Na primeira execução, o npm instala as dependências automaticamente.
  3. 03
    Abrir a interface
    O SillyTavern disponibiliza sua interface em http://localhost:8000. Abra esse endereço no seu navegador; não é necessário instalar nenhum aplicativo de desktop.
  4. 04
    Atualizar mais tarde
    Faça um git pull no diretório e reinicie o script. Seus personagens e conversas estão armazenados separadamente em data/ e não serão sobrescritos.
Terminal (Linux/macOS)
# Cloner la branche stable
git clone https://github.com/SillyTavern/SillyTavern -b release
cd SillyTavern

# Premier lancement : installe les dépendances puis démarre
./start.sh

# Interface accessible sur http://localhost:8000
PowerShell (Windows)
git clone https://github.com/SillyTavern/SillyTavern -b release
cd SillyTavern

# Double-cliquez Start.bat, ou en ligne de commande :
.\Start.bat
i
Acesso à rede e segurança
Por padrão, o SillyTavern escuta apenas em localhost. Se você quiser acessá-lo de outro dispositivo da rede, ative listen em config.yaml e configure uma autenticação (autenticação básica). Nunca exponha a interface diretamente na Internet sem proteção.

#Conectar o backend local

Depois de abrir o SillyTavern, tudo acontece na aba de conexão com a API (o ícone em forma de tomada na parte superior). O princípio: iniciar o backend de um lado e informar seu endereço ao SillyTavern do outro.

#Com KoboldCpp

Inicie o KoboldCpp com seu modelo GGUF; ele expõe sua API na porta 5001 por padrão. No SillyTavern, escolha o tipo de API « Text Completion » e o backend « KoboldCpp », depois insira a URL. Clique em Connect: o nome do modelo carregado será exibido se tudo estiver certo.

Terminal
# Lancer KoboldCpp avec un modèle et 8k de contexte
./koboldcpp --model mon-modele-rp.Q4_K_M.gguf --contextsize 8192

# API disponible sur http://localhost:5001
# Dans SillyTavern : API = Text Completion > KoboldCpp
# URL = http://localhost:5001

#Com Ollama

Ollama já está rodando como daemon na porta 11434. No SillyTavern, selecione « Text Completion » e depois o backend « Ollama », insira o endereço e escolha o modelo na lista suspensa carregada automaticamente.

Terminal
# Vérifier qu'Ollama tourne et lister les modèles
ollama list

# Le daemon écoute sur http://localhost:11434
# Dans SillyTavern : API = Text Completion > Ollama
# URL = http://localhost:11434
!
O template de instrução correto é decisivo
Cada família de modelo espera um formato específico (ChatML para Qwen 3.5/3.8 e gpt-oss, Gemma para Gemma 4, Mistral para Mistral Small…). Se as respostas forem incoerentes, interrompidas ou cheias de tags visíveis, quase sempre é devido a um template mal escolhido. Ajuste-o na aba Advanced Formatting para que corresponda ao modelo carregado.

#Criar e importar cartões de personagens

O cartão de personagem é o coração do SillyTavern. Trata-se de um arquivo PNG cuja imagem serve de avatar e cujos metadados incorporados descrevem o personagem. Você pode criar um do zero ou importar um cartão compartilhado pela comunidade.

#Os campos que importam

Descrição
A base do personagem: aparência, traços, histórico. Essas informações são inseridas permanentemente no contexto, então concentre as informações e seja concreto, sem se alongar.
Personality
Um resumo do temperamento. Útil para orientar o tom sem precisar reescrever toda a descrição.
First message
A mensagem de boas-vindas que estabelece a cena. Ela define o tom, o estilo de escrita e o formato esperado — o modelo tende a imitar sua estrutura.
Example dialogues
Exemplos de frases que mostram ao modelo como o personagem fala. Muito eficaz para fixar uma voz específica.
Scenario
O contexto da cena, separado da descrição do personagem. Útil para reutilizar o mesmo personagem em várias situações.
  1. 01
    Abrir o painel de personagens
    O ícone de personagem na barra superior abre a lista. O botão “+” cria uma ficha em branco.
  2. 02
    Preencher a descrição
    Descreva o personagem com bastante informação em pouco espaço. Muitos autores usam um formato estruturado (listas de características) em vez de um parágrafo, formato que os modelos seguem bem.
  3. 03
    Escrever a primeira mensagem
    Capriche nele: é a sua melhor ferramenta para definir o estilo. Uma mensagem de boas-vindas narrativa em terceira pessoa direciona o modelo para esse formato.
  4. 04
    Importar um cartão existente
    Arraste um arquivo PNG de cartão para a lista ou importe-o. Os cartões são compartilhados como simples arquivos de imagem nos hubs comunitários.
→
O orçamento de tokens do personagem
Tudo o que o cartão contém ocupa espaço no contexto a cada mensagem. Uma descrição de 2000 tokens em um contexto de 8k representa um quarto do orçamento consumido antes mesmo do histórico. Seja conciso: a qualidade é mais importante que a extensão.

#Mundo persistente: o lorebook

O lorebook (ou World Info) resolve o problema central das partidas longas: como manter um universo coerente sem injetar tudo o tempo todo. O princípio é a injeção condicional por palavras-chave.

Você cria entradas, cada uma associada a um ou mais termos-chave. Quando um desses termos aparece nas mensagens recentes, a entrada correspondente é injetada no contexto imediatamente antes da geração. No restante do tempo, ela não ocupa nenhum espaço. Assim, você pode descrever dezenas de locais, personagens secundários e regras sem nunca saturar o prompt.

Entrada
Um bloco de texto (o lore a ser inserido) e as palavras-chave que o acionam. Exemplo: palavra-chave “Valmont” → descrição da cidade de Valmont.
Constante versus seletivo
Uma entrada pode sempre estar ativa (regras fundamentais do universo) ou ser acionada apenas por palavra-chave (detalhes contextuais).
Profundidade de injeção
Você escolhe a posição em que a entrada é inserida no prompt, o que influencia o peso que o modelo dá a ela.
Relacionado ao personagem ou global
Um lorebook pode acompanhar uma ficha de personagem específica ou se aplicar a todas as suas conversas como um universo compartilhado.
i
Lorebook ≠ RAG
A inserção por palavras-chave é mais simples e previsível do que uma busca vetorial: ela é acionada por uma correspondência de texto, não por uma similaridade semântica. Para um universo de ficção estruturado, geralmente é mais confiável do que um RAG tradicional e permanece totalmente sob o seu controle.

#Ajustar a geração para interpretar personagens

Os parâmetros de amostragem determinam o equilíbrio entre coerência e criatividade. Para interpretação de papéis, busca-se mais variedade do que para assistência factual, sem cair na incoerência. Esses ajustes estão na aba de parâmetros de geração (ícone dos controles deslizantes).

Temperatura
O controle de criatividade/estabilidade. Em torno de 0,7 a 0,9 para um bom equilíbrio em roleplay (RP). Um valor alto demais (> 1,2) leva à incoerência; um valor baixo demais torna o personagem repetitivo e sem profundidade.
Min-P
Um sampler moderno que elimina os tokens improváveis proporcionalmente ao mais provável. Um valor de 0,05 a 0,1 melhora a qualidade da saída e permite aumentar a temperatura sem perder a coerência.
Penalidade de repetição
Penaliza a repetição dos mesmos tokens. É útil para evitar loops, mas, se a penalidade for muito alta, força o modelo a usar construções artificiais. Use com moderação.
Response length
O número máximo de tokens gerados por resposta. 200-400 tokens para respostas narrativas substanciais sem monólogos intermináveis.
Context size
Deve corresponder ao que seu backend carregou. Não adianta pedir 16k ao SillyTavern se o KoboldCpp foi iniciado apenas com 8k.
→
Começar com um preset antes de fazer alterações
SillyTavern fornece presets de sampling prontos para uso. Carregue um adequado ao RP, interprete uma cena e depois ajuste um parâmetro de cada vez. Mudar cinco controles deslizantes ao mesmo tempo torna qualquer diagnóstico impossível.

#As extensões que mudam a experiência

SillyTavern é extensível. Algumas extensões já vêm incluídas, outras são instaladas pela URL de seus repositórios. Estas são as que realmente transformam o uso.

Vector Storage (resumo da memória)
Vetoriza o histórico e reinjeta trechos relevantes de mensagens antigas, estendendo a memória além da janela de contexto. Útil para partidas muito longas.
Summarize
Gera e mantém um resumo atualizado da conversa, reinserido no prompt. O personagem se lembra dos grandes acontecimentos mesmo após centenas de mensagens.
Text-to-Speech
Dá voz aos personagens por meio de um motor TTS local. Imersão aprimorada para quem joga por voz.
Geração de imagem
Conecta-se a um backend local de imagens (como o Stable Diffusion) para ilustrar cenas e personagens em tempo real a partir do chat.
Expressões
Exibe o avatar com uma emoção correspondente ao tom da mensagem, a partir de um conjunto de sprites do personagem.
i
Cada extensão custa tokens ou VRAM
Summarize e Vector Storage consomem contexto; image generation e TTS exigem modelos próprios e, portanto, VRAM ou CPU adicionais, além dos recursos usados pelo seu LLM. Ative essas extensões conforme os recursos do seu hardware, não todas de uma vez.

#Quais modelos locais se destacam na interpretação de personagens

Nem todos os LLMs têm o mesmo desempenho na interpretação de personagens. Os modelos « instruct » alinhados para assistência tendem a sair do personagem, dar lições de moral ou recusar cenários de ficção. A comunidade prefere modelos com ajuste fino especializado, muitas vezes construídos sobre bases sólidas e depois retreinados para a narrativa e o diálogo no papel de um personagem.

Tamanho útil
Abaixo de 4B, a coerência do personagem ao longo do tempo fica prejudicada. Em 2026, uma base recente como Qwen 3.5 9B (~6,6 GB, 256k de contexto) ou Gemma 4 12B (~7,6 GB, Apache 2.0) é o ponto de equilíbrio para a maioria das placas de vídeo de faixa intermediária; um nível acima, Mistral Small 24B (~14 GB, muito competente em francês) cabe em 16 GB e oferece maior refinamento narrativo.
Ajustes finos de RP
Procure modelos explicitamente treinados para roleplay ou ficção (muitas vezes indicados como « RP », « storytelling » ou « uncensored » no Hugging Face). Os melhores fine-tunes de 2026 são construídos sobre essas bases recentes (Qwen 3.5, Mistral Small 24B, Gemma 4) em vez dos antigos Llama 2 ou Mistral 7B de 2023; eles seguem melhor o formato das fichas.
Contexto longo
Prefira um modelo que se mantenha estável com 16k+ tokens sem degradar: sessões longas exigem isso. Verifique o tamanho de contexto nativo anunciado para o modelo.
Formato GGUF
Para o KoboldCpp, continue usando modelos GGUF quantizados. Q4_K_M é o compromisso recomendado; passe para Q5_K_M ou Q8_0 se sua VRAM permitir e você quiser mais refinamento.
→
Testar uma ficha de personagem com dois ou três modelos
O mesmo personagem pode parecer monótono em um modelo e brilhante em outro. Antes de concluir que sua ficha de personagem é ruim, teste-a em alguns modelos de RP diferentes: a diferença no resultado é muitas vezes impressionante.

#Solução de problemas comuns

SillyTavern não se conecta
Verifique se o backend está funcionando bem e se a porta está correta (5001 para KoboldCpp, 11434 para Ollama). Um teste no navegador na URL da API confirma que ela responde.
Respostas com tags visíveis
Quase sempre um template de instrução inadequado. Alinhe o formato (ChatML, Gemma, Mistral…) ao do modelo em Advanced Formatting.
O personagem sai do seu papel
Aprimore a descrição e os exemplos de diálogo, abaixe um pouco a temperatura e verifique se seu prompt de sistema não entra em conflito com a ficha do personagem.
Repetições e laços
Aumente levemente a penalidade de repetição e adicione um Min-P. Se o problema persistir, o contexto pode estar saturado: ative Summarize ou reduza o tamanho da ficha do personagem.
Respostas truncadas
Response length muito baixo, ou o backend foi iniciado com um contexto menor do que o solicitado pelo SillyTavern. Alinhe os dois valores.

#Para se aprofundar

O SillyTavern é apenas uma camada: a qualidade final depende principalmente do seu backend e do modelo. Esses guias ajudam a fortalecer as bases.

KoboldCpp: instalação e início rápido
O backend de referência para o RP local: GGUF, configurações de memória e uma API com suporte nativo no SillyTavern.
O que é o Ollama e como funciona
A alternativa generalista se você prefere um único daemon na porta 11434 para todos os seus usos.
Quantificar o cache KV
Para manter contextos de roleplay (RP) mais longos na mesma placa de vídeo sem consumir VRAM em excesso.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.