Intermediário 13 minCriativo

Escrever um romance com um LLM local: método e ferramentas

Escrever um livro com uma IA não significa pedir a ela “escreva um romance para mim” e copiar o resultado — isso produz um texto morno e sem graça. O verdadeiro uso é como parceiro de escrita: um modelo que ajuda você a estruturar, a destravar uma cena e a manter a coerência dos seus personagens ao longo de centenas de páginas. Este guia mostra como fazer isso com um LLM local, com o qual seu manuscrito nunca sai da sua máquina e nenhum filtro de estilo apara sua prosa.

Por Léa B.·Atualização 2026-09-16·Testado no Windows, macOS e Linux

#Por que escrever um livro com uma IA local em vez de na nuvem

Um romance representa meses de trabalho e um texto que você não quer ver coletado para treinar um modelo, nem recusado porque uma cena é violenta, sombria ou sexualmente explícita. Os serviços de nuvem voltados ao público geral aplicam filtros de conteúdo e políticas de uso que, no caso de ficção adulta ou romances policiais noir, frequentemente interrompem o impulso criativo no pior momento.

Um LLM rodando em sua própria máquina resolve os dois problemas de uma vez. O texto permanece em seu disco: nenhum rascunho, nenhum spoiler da sua trama é enviado a terceiros. E você escolhe o modelo — incluindo versões sem restrições de estilo que escrevem a cena que você pede, sem sermões nem recusas. Uma vantagem considerável para um projeto longo: sem assinatura mensal nem contador de tokens rodando enquanto você aperfeiçoa o capítulo 12 pela décima vez.

Confidencialidade total
Seu manuscrito, suas anotações e sua trama permanecem localmente. Nada é usado para treinar um modelo de terceiros.
Sem filtro de estilo
Ficção adulta, horror, thriller cru: o modelo escreve o que a cena exige, sem bloqueio moral.
Custo fixo
Depois que o custo do equipamento estiver amortizado, você pode gerar tantos rascunhos quanto quiser sem cobrança por uso.
Disponível offline
Escrever no trem ou em um chalé sem rede, sem depender de uma conexão.

#Requisitos: hardware e stack

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

A escrita criativa é menos exigente em recursos que o código: você não precisa do maior modelo do mercado, mas de um modelo que domine bem o francês e mantenha o tom. Uma GPU de 12 GB (RTX 3060 12GB, RTX 4070) já roda com conforto um modelo de 12B–14B em Q4_K_M, o que é o nível adequado para prosa. Com 16 GB (RTX 4080), você passa para um modelo de 24B, e 24 GB (RTX 4090) ou um Mac M4 Pro com memória unificada abrem as portas para modelos de 32B, que são consideravelmente mais sutis em cenas longas.

3B (~2 GB VRAM)
Ajuda rápida, reformulações. Curto demais para manter um tom ao longo de um capítulo.
7B (~5 GB)
Pode ser usado para brainstorming e cenas curtas em uma configuração modesta com 8 GB.
14B (~9 GB)
Ponto de equilíbrio para uma GPU de 12 GB: prosa correta em francês, boa memória de contexto.
32B (~19 GB)
O melhor equilíbrio entre qualidade e execução local para um romance sério, a partir de 24 GB de VRAM ou de um Mac com memória unificada.

Quanto ao software, a stack mais simples continua sendo o Ollama como daemon (ele escuta em http://localhost:11434), acompanhado de uma interface. Open WebUI ou LM Studio são adequados para conversar conforme a necessidade; para um verdadeiro projeto de escrita, uma interface pensada para personagens e contexto persistente, como SillyTavern, muda a vida (ver «Para ir mais longe»).

Terminal — instalar o Ollama e baixar um modelo criativo
# Linux / macOS
curl -fsSL https://ollama.com/install.sh | sh

# Un modèle solide en français, quantifié Q4_K_M
ollama pull mistral-small

# Vérifier qu'il répond
ollama run mistral-small "Écris la première phrase d'un polar qui se passe à Marseille."

#Quais modelos locais escrevem melhor em francês?

Nem todos os modelos têm o mesmo desempenho em francês literário. Muitos, treinados majoritariamente com textos em inglês, produzem uma prosa correta, mas sem brilho, com construções calcadas no inglês (« Elle prit une profonde respiration »). Para ficção, prefira modelos reconhecidos como multilíngues e variantes ajustadas para a escrita.

Mistral Small (24B)
Origem francesa, excelente em francês idiomático. É a primeira opção por padrão para um romance e mantém bem o tom ao longo do texto.
Gemma (12B–27B)
Boa prosa, estilo relativamente flexível; o 27B se sai bastante bem em diálogos se você tiver VRAM suficiente.
Qwen (14B–32B)
Muito capaz, contexto longo confortável; o francês é bom, mas às vezes menos «natural» que Mistral.
Variantes criativas com ajuste fino
No Ollama e no Hugging Face, modelos derivados do tipo “writer” / “storyteller” ou sem censura escrevem cenas que os modelos de base se recusam a escrever. Testar conforme seu gênero literário.
→
Teste antes de se comprometer
Dê o mesmo trecho de teste a dois ou três modelos (uma cena de diálogo tenso, um parágrafo de descrição) e compare de ouvido. A “melhor” prosa é subjetiva: o modelo que combina com sua voz conta mais do que aquele que vence os benchmarks.
i
O contexto, o fator decisivo
Para um romance, o tamanho da janela de contexto é tão importante quanto a qualidade da prosa: é ela que determina quanto texto o modelo “vê” de uma só vez. Procure ter pelo menos 16k–32k tokens de contexto utilizável e mantenha VRAM livre para esse contexto, além da memória ocupada pelos pesos do modelo.

#O método capítulo a capítulo que dá certo

O erro de iniciante é pedir o romance inteiro. Um LLM não tem uma visão do conjunto; ele se destaca em tarefas curtas e bem delimitadas. O método que funciona parte do geral para o particular, por camadas, mantendo sempre o controle da estrutura. Você continua sendo o autor; o modelo é um roteirista e um primeiro rascunho aos quais você dita o rumo.

  1. 01
    1. O pitch e o tema
    Formule em duas frases o tema, o gênero e o que está em jogo no centro da história. Peça ao modelo três ou quatro variantes de uma frase de impacto para encontrar o ângulo, depois defina o seu de forma definitiva. Essa será sua bússola para todo o restante.
  2. 02
    2. O planejamento em atos e depois em capítulos
    Peça uma divisão em 3 atos, depois desenvolva cada ato em capítulos, com uma frase de resumo (“o que acontece”) e uma frase sobre o que está em jogo (“o que muda”) para cada capítulo. Você obtém uma sinopse de uma página, que reescreve ao seu gosto.
  3. 03
    3. O esquema de beats do capítulo
    Antes de escrever um capítulo, divida o resumo em 5 a 8 “beats”: as microetapas da cena. O modelo trabalha muito melhor com um beat específico (“Léa descobre a carta e compreende a mentira”) do que com “escreva o capítulo 4”.
  4. 04
    4. O primeiro rascunho, beat por beat
    Gere a prosa um beat de cada vez, fornecendo o beat atual e um lembrete dos personagens presentes. Corrija ou gere novamente cada trecho antes de passar ao próximo: você costura o capítulo, em vez de despejá-lo de uma só vez.
  5. 05
    5. A etapa de revisão
    Depois de escrever o capítulo à mão e à máquina, peça ao modelo uma revisão direcionada: “identifique as repetições”, “enxugue os diálogos”, “aponte as incoerências na cronologia”. Nunca aceite uma reescrita completa sem examiná-la.
!
O modelo não tem gosto, você sim
Um LLM gera texto 'aceitável' e monótono rapidamente. Se você aprovar tudo que ele propõe, seu romance terá uma voz genérica. Trate cada saída como um rascunho de assistente: mantenha a ideia, reescreva a formulação com suas palavras. A voz é a sua.

#Fichas de personagens e bíblia do universo

A coerência de um romance se apoia em uma "bíblia": um documento de referência que você e o modelo consultam constantemente. Sem ela, sua heroína terá olhos verdes no capítulo 2 e azuis no capítulo 18, e o café da esquina mudará de nome. Crie esse documento já na etapa de planejamento e enriqueça-o ao longo do processo.

Ficha de personagem
Nome, idade, aparência em 3 traços, voz/maneirismos de fala, objetivo, ferida interior, arco. Meia página por personagem principal.
Bíblia do universo
Lugares recorrentes, regras do mundo (se for ficção científica/fantasia), cronologia dos eventos, objetos importantes.
Glossário de tom
Duas ou três frases-exemplo da 'voz do livro' que você cola no início do prompt para alinhar o estilo em cada sessão.
Diário de continuidade
Uma linha por capítulo: o que cada personagem sabe nesse ponto da história. Evita revelações prematuras ou repetidas.
exemplo — fiche-personnage.md
# Léa Vasseur
- Âge : 34 ans, journaliste d'investigation à Marseille
- Apparence : cheveux courts châtains, cicatrice au sourcil gauche, toujours en veste militaire
- Voix : phrases courtes, ironie sèche, jure quand elle est acculée
- Objectif : prouver l'innocence de son frère
- Blessure : culpabilité de ne pas l'avoir cru à l'époque
- Arc : de la méfiance systématique vers la capacité à faire confiance
- Sait au ch.4 : que la lettre existe. Ignore encore : qui l'a écrite.

Na prática, você cola as fichas relevantes no início do seu prompt antes de escrever a cena (« Aqui estão os personagens presentes… escreva agora o próximo beat »). Isso é RAG artesanal: você injeta o contexto útil no momento certo, em vez de esperar que o modelo « se lembre ».

#Manter a coerência em 300 páginas

Aqui está o verdadeiro desafio técnico. Um romance de 300 páginas tem aproximadamente 120.000 palavras, ou seja, cerca de 180.000 tokens — bem além da janela de contexto de qualquer modelo local. O modelo não pode “ter lido” todo o seu livro. A coerência não vem, portanto, da memória do modelo, mas da sua disciplina em fornecer novamente a ele o contexto certo a cada cena.

Resumos em cascata
Mantenha um resumo de uma frase por capítulo. Antes de escrever o capítulo N, forneça os resumos dos capítulos anteriores, em vez do texto completo: dez linhas são suficientes para situar a ação.
Janela deslizante
Dê ao modelo o texto completo de 1 a 2 capítulos anteriores (para o tom e as transições) + os resumos de todo o restante. Você mantém a continuidade imediata sem sobrecarregar a janela de contexto.
Bíblia no início do prompt
As fichas dos personagens presentes na cena, sempre. É isso que evita inconsistências nos detalhes.
Verificações específicas
Periodicamente, peça ao modelo que releia um capítulo com uma pergunta precisa: “Há alguma contradição com este resumo da trama?” Ele identifica bem erros factuais quando a pergunta é bem delimitada.
i
Resumir é comprimir
Seu diário de resumos é um índice comprimido do seu romance. Quanto mais preciso ele for (quem sabe o quê, em que ponto está cada trama secundária), mais coerente o modelo se mantém. Atualize-o ao final de cada capítulo, nunca depois: são cinco minutos que poupam você de horas de correção.

#Ajustes criativos: temperatura e sampling

Os parâmetros de amostragem mudam radicalmente o resultado. Para ficção, busca-se variedade e surpresa sem se afastar da coerência. A temperatura é o principal controle: baixa (0,3–0,6) produz uma prosa contida e previsível, útil para trechos técnicos ou resumos; alta (0,8–1,1) libera a invenção, com maior risco de digressões.

Temperatura 0,8–1,0
A faixa adequada para a prosa narrativa: texto vivo sem se tornar incoerente. Reduza para 0,5 nos resumos e fichas.
top-p 0,9–0,95
Mantém uma boa diversidade de vocabulário ao mesmo tempo que elimina as escolhas realmente improváveis.
Penalidade de repetição ~1,1
Para evitar o hábito dos LLM de repetir as mesmas construções. Não aumentar demais, senão o estilo fica artificial.
Comprimento da resposta
Limite a geração à extensão de um beat ou de uma cena; saídas muito longas se desviam e perdem o fio da narrativa.
Ollama — opções de geração para ficção
{
  "model": "mistral-small",
  "prompt": "[fiches + beat]",
  "options": {
    "temperature": 0.9,
    "top_p": 0.92,
    "repeat_penalty": 1.1,
    "num_ctx": 16384
  }
}

#Armadilhas comuns e solução de problemas

Prosa de "IA" reconhecível
Vícios de linguagem como “um arrepio lhe percorreu a espinha”, “não importava o que o aguardava”. Proíba-os explicitamente no prompt e reescreva à mão as frases que denunciam esse estilo.
O modelo resume em vez de escrever
Ele despacha uma cena em três frases. Peça explicitamente para “mostrar, não contar”, cena por cena, com diálogos e detalhes sensoriais.
Perda do fio da narrativa no meio do capítulo
Sinal de que o contexto excedeu o limite. Reduza o comprimento das cenas, aumente num_ctx se a VRAM permitir ou recomece com um resumo claro.
Recusa ou suavização
Um modelo de base restringe uma cena pesada. Mude para uma variante ajustada por fine-tuning para escrita criativa, ou reformule deixando claro o contexto ficcional.
Todos os personagens falam da mesma forma
Insira o perfil 'voz' de cada personagem e solicite diálogos diferenciados; releia em voz alta para identificar a uniformidade.

#Para se aprofundar

Para transformar esse método em um ambiente de escrita confortável, três guias do site complementam este guia. O SillyTavern oferece uma interface pensada para personagens persistentes e contexto longo, ideal para gerenciar fichas e cenas sem precisar colar tudo novamente à mão. O guia sobre temperatura e amostragem detalha como ajustar com precisão a criatividade do seu modelo. E, se você estiver começando do zero em termos de hardware e instalação, o guia de instalação de um LLM local ajuda você a instalar e configurar a stack Ollama corretamente antes de começar seu romance.


Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.