Primafonte

llms.txt

llms.txt è un file Markdown collocato nella radice di un sito che dichiara che cos’è il sito e ne indicizza le pagine principali, perché un agente di IA possa orientarsi senza dover analizzare l’intero sito.

È una convenzione proposta, non uno standard ratificato, e la distinzione conta quando si decide quanto investirci. Scriverne uno costa un’ora. Prenderlo come garanzia che i modelli ti leggeranno sarebbe un errore.

A che cosa serve llms.txt?

Un agente che arriva su un sito deve capire che cos’è quel sito e quali pagine contano, partendo da un HTML pensato per occhi umani. llms.txt risponde a entrambe le cose in modo diretto, in Markdown e in una sola richiesta: un titolo, un paragrafo di sintesi e un elenco curato di link con una riga di spiegazione ciascuno.

Il valore sta nella selezione, non nell’essere esaustivi. Una sitemap elenca tutti gli URL e li tratta da pari; llms.txt dice quale manciata vorresti vedere citata, che è un’informazione diversa e più utile.

In che cosa differisce da robots.txt e sitemap.xml?

Tre file nella radice di un sito, tre lavori distinti. Si confondono perché condividono la posizione, e avere l’uno non sostituisce gli altri.

  • robots.txt dice che cosa un crawler può e non può scaricare. È permesso, ed è la RFC 9309 a stabilirlo.
  • sitemap.xml elenca tutti gli URL esistenti, con le loro date. È inventario.
  • llms.txt dice che cos’è il sito e quali pagine vale la pena leggere. È orientamento, ed è l’unico scritto per un lettore e non per un analizzatore.

llms.txt funziona davvero?

Risposta onesta: nessun motore importante si è impegnato pubblicamente a leggerlo, e non esiste alcuna misurazione pubblica che dimostri che cambi la frequenza con cui vieni citato. Ciò che è documentato è la convenzione in sé e un numero crescente di siti che ne pubblicano uno.

Conta nell’Indice di Citabilità per un motivo più stretto: un sito che pubblica un llms.txt aggiornato e corretto quasi sempre ha pensato anche al resto. Il suo peso può cambiare, e la metodologia lo scrive, perché una convenzione che non si consolida non dovrebbe conservare i suoi punti.

Per dare un riferimento: l’unica cosa che questo campo abbia davvero misurato viene dallo studio GEO, che ha rilevato fino al 40 % di visibilità in più nelle risposte citando fonti e portando dati. Dietro llms.txt non c’è nulla di paragonabile, e dirlo è più utile che fingere il contrario.

Da dove viene tutto questo?

Una proposta e due norme pubblicate. Leggerle insieme rende evidente la differenza fra i file, ed è lì che vive quasi tutta la confusione.

  • llmstxt.org, la proposta

    La specifica originale: che cosa contiene il file, in quale ordine e con quale struttura Markdown. È una convenzione di fatto e non una norma ratificata, e lo dice da sé.

  • RFC 9309, il protocollo di esclusione dei robot

    La norma chiusa del robots.txt, e il contrasto che spiega che cosa llms.txt non è: uno concede il permesso, l’altro offre orientamento.

  • Documentazione dei crawler di OpenAI

    Ciò che un motore pubblica davvero su come legge i siti. Utile per vedere che cosa è impegnato sul serio e che cosa resta convenzione.

Domande frequenti su llms.txt

llms.txt è uno standard ufficiale?

No. È una convenzione proposta su llmstxt.org e adottata volontariamente. Nessun motore di ricerca o di risposta si è impegnato pubblicamente a leggerlo, ed è per questo che qualsiasi strumento che prometta risultati solo per averne pubblicato uno sta promettendo più di quanto ci sia.

I modelli leggono davvero llms.txt?

Non esiste prova pubblica che i motori principali lo scarichino abitualmente. Pubblicarlo costa poco e non fa danno, e obbliga a un esercizio utile: decidere in una sola pagina che cos’è il tuo sito e quali parti vorresti vedere citate.
llms.txt: che cos’è e a che serve — Primafonte