llms.txt
llms.txt 是放在网站根目录下的一个 Markdown 文件,用来说明这个网站是什么,并列出它的主要页面,好让人工智能代理不必解析整个网站就能找到方向。
它是一项被提出的约定,而不是已经批准的标准,这个区别决定了值得在它身上投入多少。写一份花一个小时;把它当成模型一定会读你的保证,则是误判。
llms.txt 是做什么用的?
一个代理来到网站,必须从为人眼设计的 HTML 里弄清楚这个网站是什么、哪些页面重要。llms.txt 用一次请求就直接回答这两件事:一个标题、一段摘要,以及一份经过挑选的链接清单,每条附一行说明。
它的价值在于取舍,而不在于齐全。sitemap 列出全部网址并一视同仁;llms.txt 说的是其中哪几条你希望被引用,这是另一种、也更有用的信息。
它和 robots.txt、sitemap.xml 有什么不同?
网站根目录下的三个文件,三份不同的工作。它们被混为一谈是因为放在同一个位置,而有了其中一个并不能替代另外两个。
- robots.txt 说明爬虫可以抓取什么、不可以抓取什么。这是许可,由 RFC 9309 定下。
- sitemap.xml 列出所有存在的网址及其日期。这是清单。
- llms.txt 说明网站是什么、哪些页面值得读。这是导引,也是三者中唯一写给读者而非解析器的。
llms.txt 真的有用吗?
诚实的回答:没有任何一家主要引擎公开承诺会读取它,也没有公开的测量数据证明它改变了你被引用的频率。有据可查的是这项约定本身,以及越来越多发布它的网站。
它在可引用性指数里计分,理由要窄得多:一个网站如果发布了内容准确、保持更新的 llms.txt,通常其余部分也想清楚了。它的权重可能变动,方法论里也白纸黑字写着这一点,因为一项没有立住的约定不该一直保留它的分数。
作为参照:这个领域真正测量过的只有那项 GEO 研究,它发现标注来源、提供数据可以让内容在回答中的可见度最多提高 40%。llms.txt 背后没有任何可与之相比的证据,把这一点说清楚,比假装相反更有用。
这些依据是什么?
一份提案和两份已发布的规范。把三者放在一起读,这几个文件的差别就一目了然,而误解几乎都出在这里。
- llmstxt.org,提案本身
最初的规范:文件包含什么、按什么顺序、用什么 Markdown 结构。它是事实上的约定而非已批准的规范,这一点它自己就写明了。
- RFC 9309,机器人排除协议
robots.txt 的定稿规范,也是解释 llms.txt 不是什么的参照:一个给的是许可,另一个给的是导引。
- OpenAI 爬虫文档
一家引擎真正公开的、关于它如何读取网站的说明。可以用来分辨哪些是明确承诺,哪些仍然只是约定。
关于llms.txt的常见问题
llms.txt 是官方标准吗?
- 不是。它是 llmstxt.org 上提出的一项约定,由各方自愿采用。没有任何搜索引擎或回答引擎公开承诺会读取它,所以任何工具只要宣称发布一份就能带来效果,都是在夸大其词。
模型真的会读 llms.txt 吗?
- 没有公开证据显示主要引擎会例行抓取它。发布一份成本很低,也不会有坏处,而且它逼你做一件有用的事:用一页纸决定你的网站究竟是什么,以及哪些部分是你希望被引用的。