llms.txt
llms.txt ist eine Markdown-Datei im Stammverzeichnis einer Website, die angibt, was die Website ist, und ihre wichtigsten Seiten indexiert, damit sich ein KI-Agent zurechtfindet, ohne die gesamte Website auswerten zu müssen.
Es ist eine vorgeschlagene Konvention und kein ratifizierter Standard, und dieser Unterschied zählt bei der Frage, wie viel man investiert. Eine solche Datei zu schreiben kostet eine Stunde. Sie als Garantie dafür zu nehmen, dass Modelle Sie lesen, wäre ein Fehler.
Wozu dient llms.txt?
Ein Agent, der auf einer Website landet, muss aus HTML, das für menschliche Augen gebaut wurde, herausfinden, worum es geht und welche Seiten zählen. llms.txt beantwortet beides direkt, in Markdown und in einer einzigen Anfrage: ein Titel, ein Absatz Zusammenfassung und eine kuratierte Liste von Links mit je einer erklärenden Zeile.
Der Wert liegt in der Auswahl, nicht in der Vollständigkeit. Eine sitemap.xml listet alle URLs und behandelt sie als gleichrangig; llms.txt sagt, welche Handvoll Sie zitiert sehen möchten, und das ist eine andere und nützlichere Information.
Worin unterscheidet sie sich von robots.txt und sitemap.xml?
Drei Dateien im Stammverzeichnis, drei verschiedene Aufgaben. Sie werden verwechselt, weil sie am selben Ort liegen, und die eine ersetzt die anderen nicht.
- robots.txt sagt, was ein Crawler abrufen darf und was nicht. Das ist Erlaubnis, geregelt in RFC 9309.
- sitemap.xml listet alle vorhandenen URLs samt Datum. Das ist Inventar.
- llms.txt sagt, was die Website ist und welche Seiten sich zu lesen lohnen. Das ist Orientierung, und als Einzige ist sie für einen Leser geschrieben und nicht für einen Parser.
Funktioniert llms.txt wirklich?
Ehrliche Antwort: Keine große Engine hat sich öffentlich verpflichtet, sie zu lesen, und es gibt keine öffentliche Messung, die zeigt, dass sie die Zitierhäufigkeit verändert. Dokumentiert ist die Konvention selbst und eine wachsende Zahl von Websites, die eine veröffentlichen.
Im Zitierbarkeitsindex zählt sie aus einem engeren Grund: Wer eine aktuelle, korrekte llms.txt veröffentlicht, hat fast immer auch über den Rest nachgedacht. Ihr Gewicht kann sich ändern, und die Methodik sagt das schriftlich, denn eine Konvention, die sich nicht durchsetzt, sollte ihre Punkte nicht behalten.
Zum Vergleich: Das Einzige, was in diesem Feld tatsächlich gemessen wurde, stammt aus der GEO-Studie, die durch Quellenangaben und Daten bis zu 40 % mehr Sichtbarkeit in Antworten fand. Hinter llms.txt steht nichts Vergleichbares, und das zu sagen ist nützlicher, als das Gegenteil vorzugeben.
Woher stammt das?
Ein Vorschlag und zwei veröffentlichte Normen. Wer alle drei nebeneinander liest, sieht den Unterschied zwischen den Dateien sofort, und genau dort sitzt die meiste Verwirrung.
- llmstxt.org, der Vorschlag
Die ursprüngliche Spezifikation: was die Datei enthält, in welcher Reihenfolge und mit welcher Markdown-Struktur. Sie ist eine faktische Konvention und keine ratifizierte Norm, und sagt das selbst.
- RFC 9309, das Robots Exclusion Protocol
Die abgeschlossene Norm für robots.txt und der Kontrast, der erklärt, was llms.txt nicht ist: die eine erteilt Erlaubnis, die andere bietet Orientierung.
- Dokumentation der OpenAI-Crawler
Was eine Engine tatsächlich darüber veröffentlicht, wie sie Websites liest. Hilfreich, um zu sehen, was verbindlich zugesagt ist und was Konvention bleibt.
Häufige Fragen zu llms.txt
Ist llms.txt ein offizieller Standard?
- Nein. Es ist eine auf llmstxt.org vorgeschlagene Konvention, die freiwillig übernommen wird. Keine Such- oder Antwortmaschine hat öffentlich zugesagt, sie zu lesen, weshalb jedes Werkzeug, das allein durch ihre Veröffentlichung Ergebnisse verspricht, mehr behauptet als belegt ist.
Lesen Modelle llms.txt tatsächlich?
- Es gibt keine öffentlichen Belege dafür, dass die großen Engines sie regelmäßig abrufen. Sie zu veröffentlichen ist billig und schadet nicht, und sie erzwingt eine nützliche Übung: auf einer Seite zu entscheiden, was Ihre Website ist und welche Teile Sie zitiert sehen möchten.