llms.txt
llms.txt é um arquivo Markdown colocado na raiz de um site que diz o que o site é e indexa suas páginas principais, para que um agente de IA consiga se orientar sem ter que percorrer o site inteiro.
É uma convenção proposta, não um padrão ratificado, e essa distinção importa na hora de decidir quanto investir nele. Escrever um custa uma hora. Tratá-lo como garantia de que os modelos vão ler você seria um erro.
Para que serve o llms.txt?
Um agente que chega a um site precisa descobrir o que aquele site é e quais páginas importam, a partir de um HTML feito para olhos humanos. O llms.txt responde às duas coisas de forma direta, em Markdown e numa única requisição: um título, um parágrafo de resumo e uma lista curada de links com uma linha explicando cada um.
O valor está na curadoria, não em ser exaustivo. Um sitemap lista todas as URLs e as trata como iguais; o llms.txt diz qual punhado você gostaria que fosse citado, e essa é uma informação diferente e mais útil.
Em que difere de robots.txt e sitemap.xml?
Três arquivos na raiz de um site, três trabalhos distintos. São confundidos porque compartilham o lugar, e ter um não substitui os outros.
- robots.txt diz o que um rastreador pode e não pode baixar. É permissão, e quem resolve isso é a RFC 9309.
- sitemap.xml lista todas as URLs que existem, com suas datas. É inventário.
- llms.txt diz o que o site é e quais páginas valem a leitura. É orientação, e é o único escrito para um leitor e não para um analisador.
O llms.txt funciona de verdade?
Resposta honesta: nenhum motor importante se comprometeu publicamente a lê-lo, e não há medição pública mostrando que ele muda a frequência com que você é citado. O que está documentado é a convenção em si e um número crescente de sites que publicam um.
Ele pontua no Índice de Citabilidade por um motivo mais estreito: um site que publica um llms.txt atualizado e correto quase sempre pensou no resto. O peso dele pode mudar, e a metodologia diz isso por escrito, porque uma convenção que não se firma não deveria manter seus pontos.
Para dar uma referência: a única coisa que esta área mediu de verdade vem do estudo de GEO, que viu até 40 % mais visibilidade nas respostas ao citar fontes e trazer dados. Atrás do llms.txt não há nada comparável, e dizer isso é mais útil do que fingir o contrário.
De onde isso vem?
Uma proposta e duas normas publicadas. Ler as três juntas deixa óbvia a diferença entre os arquivos, que é onde mora quase toda a confusão.
- llmstxt.org, a proposta
A especificação original: o que o arquivo contém, em que ordem e com que estrutura de Markdown. É uma convenção de fato e não uma norma ratificada, e ela mesma diz isso.
- RFC 9309, o protocolo de exclusão de robôs
A norma fechada do robots.txt, e o contraste que explica o que o llms.txt não é: um concede permissão, o outro oferece orientação.
- Documentação dos rastreadores da OpenAI
O que um motor de fato publica sobre como lê os sites. Serve para ver o que está realmente comprometido e o que segue sendo convenção.
Perguntas frequentes sobre llms.txt
O llms.txt é um padrão oficial?
- Não. É uma convenção proposta em llmstxt.org e adotada de forma voluntária. Nenhum motor de busca ou de resposta se comprometeu publicamente a lê-lo, e por isso qualquer ferramenta que prometa resultados só por publicar um está vendendo mais do que existe.
Os modelos leem mesmo o llms.txt?
- Não há evidência pública de que os motores importantes o baixem com regularidade. Publicá-lo é barato e não faz mal, e obriga a um exercício útil: decidir numa página só o que o seu site é e quais partes você gostaria que fossem citadas.