Primafonte

llms.txt

llms.txt est un fichier Markdown placé à la racine d’un site qui indique ce qu’est le site et indexe ses pages principales, afin qu’un agent d’IA puisse s’y orienter sans avoir à analyser le site entier.

C’est une convention proposée et non une norme ratifiée, et cette distinction compte au moment de décider combien y investir. En écrire un coûte une heure. Le prendre pour une garantie que les modèles vous liront serait une erreur.

À quoi sert llms.txt ?

Un agent qui arrive sur un site doit deviner ce qu’est ce site et quelles pages comptent, à partir d’un HTML conçu pour des yeux humains. llms.txt répond aux deux directement, en Markdown et en une seule requête : un titre, un paragraphe de résumé et une liste choisie de liens avec une ligne d’explication pour chacun.

La valeur tient à la sélection, pas à l’exhaustivité. Un sitemap liste toutes les URL et les traite à égalité ; llms.txt dit lesquelles, parmi une poignée, vous aimeriez voir citées, ce qui est une information différente et plus utile.

En quoi diffère-t-il de robots.txt et de sitemap.xml ?

Trois fichiers à la racine d’un site, trois rôles distincts. On les confond parce qu’ils partagent un emplacement, et avoir l’un ne remplace pas les autres.

  • robots.txt dit ce qu’un robot peut et ne peut pas récupérer. C’est une permission, tranchée par la RFC 9309.
  • sitemap.xml liste toutes les URL existantes, avec leurs dates. C’est un inventaire.
  • llms.txt dit ce qu’est le site et quelles pages méritent d’être lues. C’est une orientation, et le seul des trois écrit pour un lecteur plutôt que pour un analyseur.

Est-ce que llms.txt fonctionne vraiment ?

Réponse honnête : aucun moteur important ne s’est engagé publiquement à le lire, et aucune mesure publique ne montre qu’il change la fréquence à laquelle on vous cite. Ce qui est documenté, c’est la convention elle-même et un nombre croissant de sites qui en publient un.

Il compte dans l’Indice de Citabilité pour une raison plus étroite : un site qui publie un llms.txt à jour et exact a presque toujours réfléchi au reste. Son poids peut changer, et la méthodologie l’écrit noir sur blanc, car une convention qui ne s’impose pas ne devrait pas conserver ses points.

En guise de repère : la seule chose que ce domaine ait réellement mesurée vient de l’étude GEO, qui a constaté jusqu’à 40 % de visibilité en plus dans les réponses en citant des sources et en apportant des données. Derrière llms.txt, il n’y a rien de comparable, et le dire est plus utile que de prétendre l’inverse.

D’où cela vient-il ?

Une proposition et deux normes publiées. Les lire ensemble rend évidente la différence entre ces fichiers, et c’est là que se loge presque toute la confusion.

  • llmstxt.org, la proposition

    La spécification d’origine : ce que contient le fichier, dans quel ordre et avec quelle structure Markdown. C’est une convention de fait et non une norme ratifiée, et elle le dit elle-même.

  • RFC 9309, le protocole d’exclusion des robots

    La norme arrêtée pour robots.txt, et le contraste qui explique ce que llms.txt n’est pas : l’un accorde une permission, l’autre offre une orientation.

  • Documentation des robots d’OpenAI

    Ce qu’un moteur publie réellement sur sa façon de lire les sites. Utile pour distinguer ce qui est engagé de ce qui reste une convention.

Questions fréquentes sur llms.txt

llms.txt est-il une norme officielle ?

Non. C’est une convention proposée sur llmstxt.org et adoptée volontairement. Aucun moteur de recherche ou de réponse ne s’est engagé publiquement à le lire, et c’est pourquoi un outil qui promet des résultats du seul fait d’en publier un en dit plus qu’il n’en sait.

Les modèles lisent-ils vraiment llms.txt ?

Il n’existe aucune preuve publique que les grands moteurs le récupèrent de façon habituelle. En publier un coûte peu et ne nuit pas, et cela force un exercice utile : décider en une page ce qu’est votre site et quelles parties vous aimeriez voir citées.
llms.txt : ce que c’est et à quoi ça sert — Primafonte