Primafonte

llms.txt

llms.txt é um arquivo Markdown colocado na raiz de um site que diz o que o site é e indexa suas páginas principais, para que um agente de IA consiga se orientar sem ter que percorrer o site inteiro.

É uma convenção proposta, não um padrão ratificado, e essa distinção importa na hora de decidir quanto investir nele. Escrever um custa uma hora. Tratá-lo como garantia de que os modelos vão ler você seria um erro.

Para que serve o llms.txt?

Um agente que chega a um site precisa descobrir o que aquele site é e quais páginas importam, a partir de um HTML feito para olhos humanos. O llms.txt responde às duas coisas de forma direta, em Markdown e numa única requisição: um título, um parágrafo de resumo e uma lista curada de links com uma linha explicando cada um.

O valor está na curadoria, não em ser exaustivo. Um sitemap lista todas as URLs e as trata como iguais; o llms.txt diz qual punhado você gostaria que fosse citado, e essa é uma informação diferente e mais útil.

Em que difere de robots.txt e sitemap.xml?

Três arquivos na raiz de um site, três trabalhos distintos. São confundidos porque compartilham o lugar, e ter um não substitui os outros.

  • robots.txt diz o que um rastreador pode e não pode baixar. É permissão, e quem resolve isso é a RFC 9309.
  • sitemap.xml lista todas as URLs que existem, com suas datas. É inventário.
  • llms.txt diz o que o site é e quais páginas valem a leitura. É orientação, e é o único escrito para um leitor e não para um analisador.

O llms.txt funciona de verdade?

Resposta honesta: nenhum motor importante se comprometeu publicamente a lê-lo, e não há medição pública mostrando que ele muda a frequência com que você é citado. O que está documentado é a convenção em si e um número crescente de sites que publicam um.

Ele pontua no Índice de Citabilidade por um motivo mais estreito: um site que publica um llms.txt atualizado e correto quase sempre pensou no resto. O peso dele pode mudar, e a metodologia diz isso por escrito, porque uma convenção que não se firma não deveria manter seus pontos.

Para dar uma referência: a única coisa que esta área mediu de verdade vem do estudo de GEO, que viu até 40 % mais visibilidade nas respostas ao citar fontes e trazer dados. Atrás do llms.txt não há nada comparável, e dizer isso é mais útil do que fingir o contrário.

De onde isso vem?

Uma proposta e duas normas publicadas. Ler as três juntas deixa óbvia a diferença entre os arquivos, que é onde mora quase toda a confusão.

  • llmstxt.org, a proposta

    A especificação original: o que o arquivo contém, em que ordem e com que estrutura de Markdown. É uma convenção de fato e não uma norma ratificada, e ela mesma diz isso.

  • RFC 9309, o protocolo de exclusão de robôs

    A norma fechada do robots.txt, e o contraste que explica o que o llms.txt não é: um concede permissão, o outro oferece orientação.

  • Documentação dos rastreadores da OpenAI

    O que um motor de fato publica sobre como lê os sites. Serve para ver o que está realmente comprometido e o que segue sendo convenção.

Perguntas frequentes sobre llms.txt

O llms.txt é um padrão oficial?

Não. É uma convenção proposta em llmstxt.org e adotada de forma voluntária. Nenhum motor de busca ou de resposta se comprometeu publicamente a lê-lo, e por isso qualquer ferramenta que prometa resultados só por publicar um está vendendo mais do que existe.

Os modelos leem mesmo o llms.txt?

Não há evidência pública de que os motores importantes o baixem com regularidade. Publicá-lo é barato e não faz mal, e obriga a um exercício útil: decidir numa página só o que o seu site é e quais partes você gostaria que fossem citadas.
llms.txt: o que é e para que serve — Primafonte