llms.txt: o padrão para ser citado por ChatGPT e Perplexity
O arquivo llms.txt é uma convenção simples: um arquivo Markdown colocado na raiz do seu site que apresenta seu conteúdo de forma legível para uma IA. O objetivo é ajudar modelos como ChatGPT, Perplexity ou Claude a entenderem seu site e, idealmente, citá-lo corretamente. Este guia abrange a especificação exata, a diferença em relação ao llms-full.txt, a implementação passo a passo e o que realmente muda para a visibilidade nas respostas geradas por IA (o GEO) — sem exagerar os benefícios.
#Por que llms.txt existe
Uma página web moderna é um inferno para uma máquina analisar: menus, banners de cookies, scripts, anúncios, HTML aninhado. Um humano filtra tudo isso sem pensar; um modelo de linguagem, por outro lado, precisa adivinhar onde está o conteúdo útil e tem uma janela de contexto limitada. Resultado: quando uma IA lê sua página, grande parte do orçamento de tokens dela é consumida por ruído.
llms.txt resolve esse problema. É um arquivo de texto no formato Markdown, servido na raiz do seu domínio (na URL /llms.txt), que dá a uma IA um mapa claro e conciso do seu site: de que ele trata e para quais páginas ir para os detalhes. A ideia é diretamente inspirada em robots.txt (que diz aos crawlers onde eles podem ir) e em sitemap.xml (que lista as URLs), mas pensada para ser lida por um LLM e não por um robô de indexação tradicional.
#A especificação llms.txt
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
O formato é intencionalmente minimalista e se baseia inteiramente em Markdown padrão, seguindo uma ordem precisa para que possa ser interpretado por um programa:
- Um título H1
- O nome do site ou do projeto. É o único elemento obrigatório da especificação.
- Um bloco de citação
- Uma frase de resumo (precedida por >) que descreve o site. Muito recomendada: costuma ser a primeira coisa que a IA lê.
- Parágrafos livres
- Zero ou vários blocos de texto (sem título) para fornecer contexto: a quem o site se destina, como lê-lo e eventuais convenções.
- Seções H2
- Cada H2 reúne uma lista de links Markdown para suas páginas importantes, no formato [Título](url): uma nota opcional descrevendo a página.
- Uma seção « Optional »
- Um H2 chamado exatamente Optional cujos links são marcados como secundários: uma IA com pressa pode ignorá-los para economizar contexto.
#llms.txt vs llms-full.txt
Os dois arquivos não têm a mesma finalidade e não há obrigação de ter ambos.
- llms.txt
- Um índice. Curto e estruturado, ele lista suas páginas com breves descrições. A IA o lê para entender a arquitetura do site e depois busca as páginas que interessam. Este é o arquivo a ser criado prioritariamente.
- llms-full.txt
- O conteúdo completo do site (ou da documentação) concatenado em um único arquivo Markdown grande. A IA pode processá-lo de uma só vez, sem fazer outras requisições. Útil para uma documentação técnica que se quer carregar inteira em um contexto longo.
Na prática: llms.txt para um site editorial como um blog ou um catálogo de guias; llms-full.txt como complemento se o seu conteúdo for documentação que você queira poder “colar” inteira em um LLM. Atenção: llms-full.txt pode rapidamente ocupar vários megabytes — só o gere se isso fizer sentido para o seu caso.
#Criar seu arquivo passo a passo
- 01Listar suas páginas que realmente importamNão inclua tudo. Selecione as 10 a 50 páginas que representam seu valor: guias principais, páginas de produto, documentação essencial. O objetivo é um índice com alta concentração de informações relevantes, não uma cópia do sitemap.
- 02Redija o cabeçalhoUm H1 com o nome do site, seguido de um blockquote de uma frase que resuma precisamente o que você oferece. Seja factual: essa frase frequentemente será reutilizada exatamente assim pela IA para apresentar você.
- 03Agrupar os links por seção H2Uma seção por tema (por exemplo, « Instalação », « Hardware », « RAG »). Para cada link, adicione após os dois-pontos uma nota curta que diga o que a página oferece. Essas notas ajudam a IA a escolher a página certa.
- 04Adicionar uma seção OptionalColoque nessa seção as páginas de serviço (avisos legais, contato, sobre), para que a IA saiba que são secundárias.
- 05Validar o MarkdownVerifique se é realmente Markdown válido e se todos os links são absolutos e funcionam. Um erro de sintaxe compromete a utilidade do arquivo.
#Implantar em um site estático ou WordPress
O arquivo deve estar acessível no endereço exato https://votre-domaine.fr/llms.txt, servido como texto simples (Content-Type text/plain ou text/markdown). O método depende da sua hospedagem.
Em um site estático (Hugo, Astro, Eleventy, uma simples pasta HTML), é trivial: coloque o arquivo llms.txt na raiz da pasta publicada (geralmente public/ ou static/), no mesmo local que robots.txt. Ele será servido automaticamente.
No WordPress, não há um campo dedicado. Três opções: colocar o arquivo na raiz via FTP/SFTP (ao lado de wp-config.php); usar uma extensão de SEO recente (várias, incluindo versões do Yoast e do Rank Math, sabem gerar um llms.txt); ou adicionar uma regra que disponibilize o arquivo por meio de um endpoint. A opção via FTP continua sendo a mais simples e previsível.
#GEO: ser citado pelos motores de resposta de IA
O GEO (Generative Engine Optimization) está para o ChatGPT, o Perplexity ou os AI Overviews do Google assim como o SEO está para a pesquisa tradicional: é o conjunto de práticas para aparecer — e ser citado — nas respostas geradas por uma IA. A mudança fundamental é simples: em um mecanismo de respostas, o usuário lê uma síntese e clica muito menos. O que importa agora não é apenas estar na primeira página, mas ser a fonte que a IA utiliza e à qual atribui as informações.
llms.txt segue essa lógica: dar aos modelos acesso organizado a um conteúdo bem dividido e claramente descrito. Mas vamos ser precisos sobre a cadeia de causalidade, porque é nesse ponto que muitos artigos exageram.
- O que realmente ajuda o GEO
- Conteúdo factual, estruturado em seções claras, com respostas diretas no início da página e dados datados e acompanhados de fontes. É isso que os motores de resposta recompensam, com ou sem llms.txt.
- O papel do llms.txt
- Facilitar a compreensão da estrutura do seu site e fornecer descrições que a IA possa reutilizar. Isso facilita a leitura por máquinas, não é um sinal mágico de classificação.
#O que o llms.txt não faz (sejamos honestos)
Duas limitações estruturais para ter em mente. Primeiro, llms.txt não bloqueia ninguém nem obriga ninguém a nada: um crawler que não o conhece continua lendo seu HTML normalmente — para controlar o acesso de robôs de IA, você precisa ajustar o robots.txt (e as diretivas user-agent dos crawlers de IA), não o llms.txt. Segundo, um arquivo nunca compensa um conteúdo fraco: se suas páginas forem vagas ou desatualizadas, um bom índice não as tornará citáveis.
Então por que implantar? Porque o custo é quase nulo, o exercício força você a esclarecer a arquitetura e as descrições do seu site (o que também beneficia seus leitores humanos e o SEO tradicional), e se a adoção começar a crescer, você já estará preparado. É um seguro de baixo custo, não uma varinha mágica.
#Relato de experiência: o QualLLM o implementa
Publicamos um llms.txt na raiz do QualLLM há vários meses. Na prática, ele é gerado no build a partir do nosso catálogo de guias: cada guia se torna uma linha, agrupada por categoria (Instalação, Hardware, RAG…), com sua descrição extraída do campo meta. Isso garante que o arquivo nunca fique desatualizado enquanto um guia existir.
- O que observamos
- É impossível atribuir com segurança um aumento de citações apenas ao arquivo: muitas variáveis mudam ao mesmo tempo (novos conteúdos, notoriedade, evolução dos mecanismos de busca). Portanto, não alegaremos um efeito expresso em números.
- O verdadeiro benefício mensurável
- O exercício de geração nos obrigou a ter descrições curtas, precisas e sem jargões para cada guia. Essa revisão foi útil em todos os lugares: tags meta, prévias nos resultados de busca, coerência editorial.
- O custo
- Uma vez escrito o script de geração, não há manutenção. É essa relação custo-benefício que justifica mantê-lo, independentemente do seu impacto GEO exato.
Nossa posição: implemente-o para manter tudo organizado e se antecipar, não porque alguém promete citações a você. E concentre seus esforços no que realmente importa — a qualidade e a estrutura do próprio conteúdo.
#Para se aprofundar
Esses guias aprofundam os conceitos abordados aqui sobre a forma como as IAs recuperam e citam informações:
- Entender o RAG
- « O que é RAG e como funciona » explica como uma IA busca conteúdo externo para responder — exatamente o mecanismo que o llms.txt busca facilitar.
- Confiabilidade e citações
- “Alucinações: por que seu LLM local inventa e como limitar” mostra por que a indicação de fontes e a estrutura são tão importantes para respostas confiáveis.
- Notebooks de fontes
- « NotebookLM local: as alternativas open-source » ilustra concretamente perguntas e respostas com citações baseadas em um corpus de fontes.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.