Escrever um romance com um LLM local: método e ferramentas
Escrever um livro com uma IA não significa pedir a ela “escreva um romance para mim” e copiar o resultado — isso produz um texto morno e sem graça. O verdadeiro uso é como parceiro de escrita: um modelo que ajuda você a estruturar, a destravar uma cena e a manter a coerência dos seus personagens ao longo de centenas de páginas. Este guia mostra como fazer isso com um LLM local, com o qual seu manuscrito nunca sai da sua máquina e nenhum filtro de estilo apara sua prosa.
#Por que escrever um livro com uma IA local em vez de na nuvem
Um romance representa meses de trabalho e um texto que você não quer ver coletado para treinar um modelo, nem recusado porque uma cena é violenta, sombria ou sexualmente explícita. Os serviços de nuvem voltados ao público geral aplicam filtros de conteúdo e políticas de uso que, no caso de ficção adulta ou romances policiais noir, frequentemente interrompem o impulso criativo no pior momento.
Um LLM rodando em sua própria máquina resolve os dois problemas de uma vez. O texto permanece em seu disco: nenhum rascunho, nenhum spoiler da sua trama é enviado a terceiros. E você escolhe o modelo — incluindo versões sem restrições de estilo que escrevem a cena que você pede, sem sermões nem recusas. Uma vantagem considerável para um projeto longo: sem assinatura mensal nem contador de tokens rodando enquanto você aperfeiçoa o capítulo 12 pela décima vez.
- Confidencialidade total
- Seu manuscrito, suas anotações e sua trama permanecem localmente. Nada é usado para treinar um modelo de terceiros.
- Sem filtro de estilo
- Ficção adulta, horror, thriller cru: o modelo escreve o que a cena exige, sem bloqueio moral.
- Custo fixo
- Depois que o custo do equipamento estiver amortizado, você pode gerar tantos rascunhos quanto quiser sem cobrança por uso.
- Disponível offline
- Escrever no trem ou em um chalé sem rede, sem depender de uma conexão.
#Requisitos: hardware e stack
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
A escrita criativa é menos exigente em recursos que o código: você não precisa do maior modelo do mercado, mas de um modelo que domine bem o francês e mantenha o tom. Uma GPU de 12 GB (RTX 3060 12GB, RTX 4070) já roda com conforto um modelo de 12B–14B em Q4_K_M, o que é o nível adequado para prosa. Com 16 GB (RTX 4080), você passa para um modelo de 24B, e 24 GB (RTX 4090) ou um Mac M4 Pro com memória unificada abrem as portas para modelos de 32B, que são consideravelmente mais sutis em cenas longas.
- 3B (~2 GB VRAM)
- Ajuda rápida, reformulações. Curto demais para manter um tom ao longo de um capítulo.
- 7B (~5 GB)
- Pode ser usado para brainstorming e cenas curtas em uma configuração modesta com 8 GB.
- 14B (~9 GB)
- Ponto de equilíbrio para uma GPU de 12 GB: prosa correta em francês, boa memória de contexto.
- 32B (~19 GB)
- O melhor equilíbrio entre qualidade e execução local para um romance sério, a partir de 24 GB de VRAM ou de um Mac com memória unificada.
Quanto ao software, a stack mais simples continua sendo o Ollama como daemon (ele escuta em http://localhost:11434), acompanhado de uma interface. Open WebUI ou LM Studio são adequados para conversar conforme a necessidade; para um verdadeiro projeto de escrita, uma interface pensada para personagens e contexto persistente, como SillyTavern, muda a vida (ver «Para ir mais longe»).
#Quais modelos locais escrevem melhor em francês?
Nem todos os modelos têm o mesmo desempenho em francês literário. Muitos, treinados majoritariamente com textos em inglês, produzem uma prosa correta, mas sem brilho, com construções calcadas no inglês (« Elle prit une profonde respiration »). Para ficção, prefira modelos reconhecidos como multilíngues e variantes ajustadas para a escrita.
- Mistral Small (24B)
- Origem francesa, excelente em francês idiomático. É a primeira opção por padrão para um romance e mantém bem o tom ao longo do texto.
- Gemma (12B–27B)
- Boa prosa, estilo relativamente flexível; o 27B se sai bastante bem em diálogos se você tiver VRAM suficiente.
- Qwen (14B–32B)
- Muito capaz, contexto longo confortável; o francês é bom, mas às vezes menos «natural» que Mistral.
- Variantes criativas com ajuste fino
- No Ollama e no Hugging Face, modelos derivados do tipo “writer” / “storyteller” ou sem censura escrevem cenas que os modelos de base se recusam a escrever. Testar conforme seu gênero literário.
#O método capítulo a capítulo que dá certo
O erro de iniciante é pedir o romance inteiro. Um LLM não tem uma visão do conjunto; ele se destaca em tarefas curtas e bem delimitadas. O método que funciona parte do geral para o particular, por camadas, mantendo sempre o controle da estrutura. Você continua sendo o autor; o modelo é um roteirista e um primeiro rascunho aos quais você dita o rumo.
- 011. O pitch e o temaFormule em duas frases o tema, o gênero e o que está em jogo no centro da história. Peça ao modelo três ou quatro variantes de uma frase de impacto para encontrar o ângulo, depois defina o seu de forma definitiva. Essa será sua bússola para todo o restante.
- 022. O planejamento em atos e depois em capítulosPeça uma divisão em 3 atos, depois desenvolva cada ato em capítulos, com uma frase de resumo (“o que acontece”) e uma frase sobre o que está em jogo (“o que muda”) para cada capítulo. Você obtém uma sinopse de uma página, que reescreve ao seu gosto.
- 033. O esquema de beats do capítuloAntes de escrever um capítulo, divida o resumo em 5 a 8 “beats”: as microetapas da cena. O modelo trabalha muito melhor com um beat específico (“Léa descobre a carta e compreende a mentira”) do que com “escreva o capítulo 4”.
- 044. O primeiro rascunho, beat por beatGere a prosa um beat de cada vez, fornecendo o beat atual e um lembrete dos personagens presentes. Corrija ou gere novamente cada trecho antes de passar ao próximo: você costura o capítulo, em vez de despejá-lo de uma só vez.
- 055. A etapa de revisãoDepois de escrever o capítulo à mão e à máquina, peça ao modelo uma revisão direcionada: “identifique as repetições”, “enxugue os diálogos”, “aponte as incoerências na cronologia”. Nunca aceite uma reescrita completa sem examiná-la.
#Fichas de personagens e bíblia do universo
A coerência de um romance se apoia em uma "bíblia": um documento de referência que você e o modelo consultam constantemente. Sem ela, sua heroína terá olhos verdes no capítulo 2 e azuis no capítulo 18, e o café da esquina mudará de nome. Crie esse documento já na etapa de planejamento e enriqueça-o ao longo do processo.
- Ficha de personagem
- Nome, idade, aparência em 3 traços, voz/maneirismos de fala, objetivo, ferida interior, arco. Meia página por personagem principal.
- Bíblia do universo
- Lugares recorrentes, regras do mundo (se for ficção científica/fantasia), cronologia dos eventos, objetos importantes.
- Glossário de tom
- Duas ou três frases-exemplo da 'voz do livro' que você cola no início do prompt para alinhar o estilo em cada sessão.
- Diário de continuidade
- Uma linha por capítulo: o que cada personagem sabe nesse ponto da história. Evita revelações prematuras ou repetidas.
Na prática, você cola as fichas relevantes no início do seu prompt antes de escrever a cena (« Aqui estão os personagens presentes… escreva agora o próximo beat »). Isso é RAG artesanal: você injeta o contexto útil no momento certo, em vez de esperar que o modelo « se lembre ».
#Manter a coerência em 300 páginas
Aqui está o verdadeiro desafio técnico. Um romance de 300 páginas tem aproximadamente 120.000 palavras, ou seja, cerca de 180.000 tokens — bem além da janela de contexto de qualquer modelo local. O modelo não pode “ter lido” todo o seu livro. A coerência não vem, portanto, da memória do modelo, mas da sua disciplina em fornecer novamente a ele o contexto certo a cada cena.
- Resumos em cascata
- Mantenha um resumo de uma frase por capítulo. Antes de escrever o capítulo N, forneça os resumos dos capítulos anteriores, em vez do texto completo: dez linhas são suficientes para situar a ação.
- Janela deslizante
- Dê ao modelo o texto completo de 1 a 2 capítulos anteriores (para o tom e as transições) + os resumos de todo o restante. Você mantém a continuidade imediata sem sobrecarregar a janela de contexto.
- Bíblia no início do prompt
- As fichas dos personagens presentes na cena, sempre. É isso que evita inconsistências nos detalhes.
- Verificações específicas
- Periodicamente, peça ao modelo que releia um capítulo com uma pergunta precisa: “Há alguma contradição com este resumo da trama?” Ele identifica bem erros factuais quando a pergunta é bem delimitada.
#Ajustes criativos: temperatura e sampling
Os parâmetros de amostragem mudam radicalmente o resultado. Para ficção, busca-se variedade e surpresa sem se afastar da coerência. A temperatura é o principal controle: baixa (0,3–0,6) produz uma prosa contida e previsível, útil para trechos técnicos ou resumos; alta (0,8–1,1) libera a invenção, com maior risco de digressões.
- Temperatura 0,8–1,0
- A faixa adequada para a prosa narrativa: texto vivo sem se tornar incoerente. Reduza para 0,5 nos resumos e fichas.
- top-p 0,9–0,95
- Mantém uma boa diversidade de vocabulário ao mesmo tempo que elimina as escolhas realmente improváveis.
- Penalidade de repetição ~1,1
- Para evitar o hábito dos LLM de repetir as mesmas construções. Não aumentar demais, senão o estilo fica artificial.
- Comprimento da resposta
- Limite a geração à extensão de um beat ou de uma cena; saídas muito longas se desviam e perdem o fio da narrativa.
#Armadilhas comuns e solução de problemas
- Prosa de "IA" reconhecível
- Vícios de linguagem como “um arrepio lhe percorreu a espinha”, “não importava o que o aguardava”. Proíba-os explicitamente no prompt e reescreva à mão as frases que denunciam esse estilo.
- O modelo resume em vez de escrever
- Ele despacha uma cena em três frases. Peça explicitamente para “mostrar, não contar”, cena por cena, com diálogos e detalhes sensoriais.
- Perda do fio da narrativa no meio do capítulo
- Sinal de que o contexto excedeu o limite. Reduza o comprimento das cenas, aumente num_ctx se a VRAM permitir ou recomece com um resumo claro.
- Recusa ou suavização
- Um modelo de base restringe uma cena pesada. Mude para uma variante ajustada por fine-tuning para escrita criativa, ou reformule deixando claro o contexto ficcional.
- Todos os personagens falam da mesma forma
- Insira o perfil 'voz' de cada personagem e solicite diálogos diferenciados; releia em voz alta para identificar a uniformidade.
#Para se aprofundar
Para transformar esse método em um ambiente de escrita confortável, três guias do site complementam este guia. O SillyTavern oferece uma interface pensada para personagens persistentes e contexto longo, ideal para gerenciar fichas e cenas sem precisar colar tudo novamente à mão. O guia sobre temperatura e amostragem detalha como ajustar com precisão a criatividade do seu modelo. E, se você estiver começando do zero em termos de hardware e instalação, o guia de instalação de um LLM local ajuda você a instalar e configurar a stack Ollama corretamente antes de começar seu romance.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.