llms.txt
llms.txt es un fichero en Markdown colocado en la raíz de una web que dice qué es el sitio e indexa sus páginas principales, para que un agente de IA pueda orientarse sin tener que recorrer la web entera.
Es una convención propuesta, no un estándar ratificado, y esa distinción importa a la hora de decidir cuánto invertir en él. Escribir uno cuesta una hora. Tratarlo como garantía de que los modelos van a leerte sería un error.
¿Para qué sirve el llms.txt?
Un agente que llega a una web tiene que averiguar qué es el sitio y qué páginas importan, a partir de un HTML pensado para ojos humanos. El llms.txt responde a las dos cosas de forma directa, en Markdown y en una sola petición: un título, un párrafo de resumen y una lista curada de enlaces con una línea explicando cada uno.
El valor está en la curación, no en ser exhaustivo. Un sitemap lista todas las URL y las trata como iguales; el llms.txt dice cuáles son el puñado que te gustaría que citaran, que es una información distinta y más útil.
¿En qué se diferencia de robots.txt y de sitemap.xml?
Tres ficheros en la raíz de una web, tres trabajos distintos. Se confunden porque comparten sitio, y tener uno no sustituye a los otros.
- robots.txt dice qué puede y qué no puede descargar un rastreador. Es permiso, y lo zanja la RFC 9309.
- sitemap.xml lista todas las URL que existen, con sus fechas. Es inventario.
- llms.txt dice qué es el sitio y qué páginas merece la pena leer. Es orientación, y es el único escrito para un lector y no para un analizador.
¿El llms.txt funciona de verdad?
Respuesta honesta: ningún motor importante se ha comprometido públicamente a leerlo, y no hay ninguna medición pública que demuestre que cambia con qué frecuencia te citan. Lo que sí está documentado es la convención en sí y un número creciente de webs que publican uno.
Puntúa en el Índice de Citabilidad por una razón más estrecha: una web que publica un llms.txt al día y correcto casi siempre ha pensado en lo demás. Su peso puede cambiar, y la metodología lo dice por escrito, porque una convención que no se consolide no debería conservar sus puntos.
Para poner una referencia: lo único que este campo ha medido de verdad es el estudio de GEO, que vio hasta un 40 % más de visibilidad en las respuestas al citar fuentes y aportar datos. Detrás del llms.txt no hay nada comparable, y decirlo es más útil que aparentar lo contrario.
¿De dónde sale esto?
Una propuesta y dos normas publicadas. Leer las tres juntas es lo que hace evidente la diferencia entre los ficheros, que es donde vive casi toda la confusión.
- llmstxt.org, la propuesta
La especificación original: qué contiene el fichero, en qué orden y con qué estructura de Markdown. Es una convención de hecho y no una norma ratificada, y lo dice ella misma.
- RFC 9309, el protocolo de exclusión de robots
La norma cerrada del robots.txt, y el contraste que explica lo que el llms.txt no es: uno concede permiso, el otro ofrece orientación.
- Documentación de los rastreadores de OpenAI
Lo que un motor sí publica sobre cómo lee las webs. Sirve para ver qué está comprometido de verdad y qué sigue siendo convención.
Preguntas frecuentes sobre llms.txt
¿El llms.txt es un estándar oficial?
- No. Es una convención propuesta en llmstxt.org y adoptada de forma voluntaria. Ningún motor de búsqueda ni de respuestas se ha comprometido públicamente a leerlo, y por eso cualquier herramienta que prometa resultados por publicar uno está vendiendo más de lo que hay.
¿Los modelos leen de verdad el llms.txt?
- No hay evidencia pública de que los motores importantes lo descarguen de forma habitual. Publicarlo es barato y no hace daño, y obliga a un ejercicio útil: decidir en una sola página qué es tu sitio y qué partes te gustaría que citaran.