Primafonte

llms.txt

llms.txt 是放在网站根目录下的一个 Markdown 文件,用来说明这个网站是什么,并列出它的主要页面,好让人工智能代理不必解析整个网站就能找到方向。

它是一项被提出的约定,而不是已经批准的标准,这个区别决定了值得在它身上投入多少。写一份花一个小时;把它当成模型一定会读你的保证,则是误判。

llms.txt 是做什么用的?

一个代理来到网站,必须从为人眼设计的 HTML 里弄清楚这个网站是什么、哪些页面重要。llms.txt 用一次请求就直接回答这两件事:一个标题、一段摘要,以及一份经过挑选的链接清单,每条附一行说明。

它的价值在于取舍,而不在于齐全。sitemap 列出全部网址并一视同仁;llms.txt 说的是其中哪几条你希望被引用,这是另一种、也更有用的信息。

它和 robots.txt、sitemap.xml 有什么不同?

网站根目录下的三个文件,三份不同的工作。它们被混为一谈是因为放在同一个位置,而有了其中一个并不能替代另外两个。

  • robots.txt 说明爬虫可以抓取什么、不可以抓取什么。这是许可,由 RFC 9309 定下。
  • sitemap.xml 列出所有存在的网址及其日期。这是清单。
  • llms.txt 说明网站是什么、哪些页面值得读。这是导引,也是三者中唯一写给读者而非解析器的。

llms.txt 真的有用吗?

诚实的回答:没有任何一家主要引擎公开承诺会读取它,也没有公开的测量数据证明它改变了你被引用的频率。有据可查的是这项约定本身,以及越来越多发布它的网站。

它在可引用性指数里计分,理由要窄得多:一个网站如果发布了内容准确、保持更新的 llms.txt,通常其余部分也想清楚了。它的权重可能变动,方法论里也白纸黑字写着这一点,因为一项没有立住的约定不该一直保留它的分数。

作为参照:这个领域真正测量过的只有那项 GEO 研究,它发现标注来源、提供数据可以让内容在回答中的可见度最多提高 40%。llms.txt 背后没有任何可与之相比的证据,把这一点说清楚,比假装相反更有用。

这些依据是什么?

一份提案和两份已发布的规范。把三者放在一起读,这几个文件的差别就一目了然,而误解几乎都出在这里。

  • llmstxt.org,提案本身

    最初的规范:文件包含什么、按什么顺序、用什么 Markdown 结构。它是事实上的约定而非已批准的规范,这一点它自己就写明了。

  • RFC 9309,机器人排除协议

    robots.txt 的定稿规范,也是解释 llms.txt 不是什么的参照:一个给的是许可,另一个给的是导引。

  • OpenAI 爬虫文档

    一家引擎真正公开的、关于它如何读取网站的说明。可以用来分辨哪些是明确承诺,哪些仍然只是约定。

关于llms.txt的常见问题

llms.txt 是官方标准吗?

不是。它是 llmstxt.org 上提出的一项约定,由各方自愿采用。没有任何搜索引擎或回答引擎公开承诺会读取它,所以任何工具只要宣称发布一份就能带来效果,都是在夸大其词。

模型真的会读 llms.txt 吗?

没有公开证据显示主要引擎会例行抓取它。发布一份成本很低,也不会有坏处,而且它逼你做一件有用的事:用一页纸决定你的网站究竟是什么,以及哪些部分是你希望被引用的。
llms.txt:它是什么 — Primafonte