Primafonte

网络可引用性现状

我们每月公布 Primafonte 在所分析的网站上发现了什么:有多少已经准备好被模型引用,有多少没有,以及最常出问题的究竟是什么。

这些是来自真实分析的汇总数字。任何具体网站及其分数都不会出现:所公布的内容讲的是整体,不针对任何人。

样本

2026年9月 分析了 11 个网站,使用方法论 0.15.0 · 阈值暂定 测量。

本月的样本偏小:11 个网站。这些数字来自真实分析,没有任何估算,但应当按它本来的样子来读——一次小规模的计数——而不是当作整个行业的状况。

数字按方法论版本分组。判定标准随时间变过,把不同版本混在一起,会让月度之间的比较失去意义。

分数是怎么分布的?

分数不是按十分一档来归类的,而是按它们的含义:模型能否把这个网站当作来源,能否找到却无法可靠地引用,是能用但有明确的盲区,还是根本没有结构性障碍。所处的区间比确切的数字更要紧,因为它才说明有没有需要修的东西。

就绪 — 没有结构性障碍
7 · 64%
可引用但有缺口 — 能用,只是有几处明确的盲区
1 · 9%
部分可读 — 它们能找到你,但无法可靠地引用你
2 · 18%
不可引用 — 各模型无法把这个网站当作来源
1 · 9%

最容易不通过的

各项检查中未通过网站的比例,只在能够测量的那些网站上计算。无结论的部分被排除在外,和计分时一样。

描述的一致性
100% · 10/10
可读取的联系方式
73% · 8/11
内容中的数据
70% · 7/10
写成问句的标题
60% · 6/10
已声明的署名
55% · 6/11
用 sameAs 声明的外部主页
55% · 6/11
指向外部来源的链接
55% · 6/11
Markdown 的内容协商
36% · 4/11
发布日期与修订日期
36% · 4/11
列表与表格
36% · 4/11

几乎所有人都做到了什么?

大多数网站都能通过这五项,看它们和看那些不通过的一样重要:一项人人都通过的检查区分不了任何人;如果某一项长期停在这里,就得判断它是否还有贡献,或者只是占着一份权重,而那份权重给别的检查更合适。

给机器人和给人的内容一致
100% · 11/11
爬虫没有被拦截
100% · 11/11
渲染比
100% · 11/11
不依赖 JavaScript 的主要内容
100% · 11/11
引用你的爬虫没有被屏蔽
100% · 11/11

还有哪些月份的数据?

每个月都单独公布,并注明测量时所用的方法论版本。不同版本从不混在一起:判定标准改过好几次,把用不同规则测出来的月份拼在一起,得到的曲线再好看也没有意义。

这些数字是从哪儿来的?

本页的数字来自真实的分析,由方法论中记录的那套引擎执行。这些检查所依据的标准和研究如下,任何人都可以自行核对。

  • GEO: Generative Engine Optimization

    这项研究测量了引用来源、提供数据和加入引文的效果:在回答中的可见度最多可提高四成。

  • schema.org

    结构化数据据以校验的词汇表,这里统计的两项检查就出自它。

  • RFC 9309

    robots.txt 标准,三项爬虫检查都出自它。

  • llms.txt

    面向智能体的索引文件约定,目前仍无定稿规范。

校准研究

除了大家主动请求的分析之外,我们还测量了一批自选样本,用来校准方法论的阈值。这些数字就来自那里,并且单独公布,因为网站是我们自己挑的,而这会改变数据的含义。

321 个域名,来自西班牙、英国、美国和欧洲其他地区,涵盖品牌、服务和中型企业,于 2026年8月4日 用方法论 0.7.0 · 阈值暂定 测量。数字是在能够完整测完的 226 个域名上计算的。

有 51 个进不去:它们的防火墙中断了分析。这占到有所响应的尝试的 18 %。另有 41 个没有响应,或者没有可分析的内容。

61

样本平均分

样本的分数是怎么分布的?

这批样本是逐个行业手工挑出来的,所以这个分布描述的是这一组网站,而不是别的任何一组。它不是整个网络的写照,而是我们为了校准而挑出来的那些网站的写照——这两件事相差不小,值得分清楚。

就绪 — 没有结构性障碍
9 · 4%
可引用但有缺口 — 能用,只是有几处明确的盲区
124 · 55%
部分可读 — 它们能找到你,但无法可靠地引用你
80 · 35%
不可引用 — 各模型无法把这个网站当作来源
13 · 6%

最容易不通过的

各项检查中未通过网站的比例,只统计能够测量的那些。旁边是落在这个比例里的网站数量。

对引用你的爬虫所声明的立场
97% · 215/222
Markdown 的内容协商
96% · 217/226
每个标题之后的直接回答
95% · 194/204
结构化的常见问题
94% · 212/226
已声明实体类型与业务类型
91% · 206/226
用于发现的 Link 响应头
85% · 192/226
llms.txt 文件
82% · 182/222
脱离上下文仍站得住的段落
66% · 149/226

样本里几乎所有网站都做到了什么?

这些是几乎没有网站不通过的检查。它们是上面那份清单的配重:如果只公布失败的部分,画出来的图景会比现实更黑,而一套只展示坏消息的方法论,就太像一份销售说辞了。

爬虫没有被拦截
100% · 226/226
首字节时间
95% · 215/226
引用你的爬虫没有被屏蔽
94% · 209/222
robots.txt 可访问且可解析
91% · 202/222
给机器人和给人的内容一致
88% · 172/195
品牌名称的一致性
85% · 160/188
可辨认的公司或作者页面
80% · 181/226
干净的跳转链路
79% · 179/226

样本是逐个行业手工挑出来的,因此并不代表整个网络:它描述的是这一批网站,不是别的。域名清单已在项目仓库中公布,且没有任何域名在这里连同分数一起出现。