网络可引用性现状
我们每月公布 Primafonte 在所分析的网站上发现了什么:有多少已经准备好被模型引用,有多少没有,以及最常出问题的究竟是什么。
这些是来自真实分析的汇总数字。任何具体网站及其分数都不会出现:所公布的内容讲的是整体,不针对任何人。
样本
2026年9月 分析了 11 个网站,使用方法论 0.15.0 · 阈值暂定 测量。
本月的样本偏小:11 个网站。这些数字来自真实分析,没有任何估算,但应当按它本来的样子来读——一次小规模的计数——而不是当作整个行业的状况。
数字按方法论版本分组。判定标准随时间变过,把不同版本混在一起,会让月度之间的比较失去意义。
分数是怎么分布的?
分数不是按十分一档来归类的,而是按它们的含义:模型能否把这个网站当作来源,能否找到却无法可靠地引用,是能用但有明确的盲区,还是根本没有结构性障碍。所处的区间比确切的数字更要紧,因为它才说明有没有需要修的东西。
- 就绪 — 没有结构性障碍
- 7 · 64%
- 可引用但有缺口 — 能用,只是有几处明确的盲区
- 1 · 9%
- 部分可读 — 它们能找到你,但无法可靠地引用你
- 2 · 18%
- 不可引用 — 各模型无法把这个网站当作来源
- 1 · 9%
最容易不通过的
各项检查中未通过网站的比例,只在能够测量的那些网站上计算。无结论的部分被排除在外,和计分时一样。
- 描述的一致性
- 100% · 10/10
- 可读取的联系方式
- 73% · 8/11
- 内容中的数据
- 70% · 7/10
- 写成问句的标题
- 60% · 6/10
- 已声明的署名
- 55% · 6/11
- 用 sameAs 声明的外部主页
- 55% · 6/11
- 指向外部来源的链接
- 55% · 6/11
- Markdown 的内容协商
- 36% · 4/11
- 发布日期与修订日期
- 36% · 4/11
- 列表与表格
- 36% · 4/11
几乎所有人都做到了什么?
大多数网站都能通过这五项,看它们和看那些不通过的一样重要:一项人人都通过的检查区分不了任何人;如果某一项长期停在这里,就得判断它是否还有贡献,或者只是占着一份权重,而那份权重给别的检查更合适。
- 给机器人和给人的内容一致
- 100% · 11/11
- 爬虫没有被拦截
- 100% · 11/11
- 渲染比
- 100% · 11/11
- 不依赖 JavaScript 的主要内容
- 100% · 11/11
- 引用你的爬虫没有被屏蔽
- 100% · 11/11
这些数字是从哪儿来的?
本页的数字来自真实的分析,由方法论中记录的那套引擎执行。这些检查所依据的标准和研究如下,任何人都可以自行核对。
- GEO: Generative Engine Optimization
这项研究测量了引用来源、提供数据和加入引文的效果:在回答中的可见度最多可提高四成。
- schema.org
结构化数据据以校验的词汇表,这里统计的两项检查就出自它。
- RFC 9309
robots.txt 标准,三项爬虫检查都出自它。
- llms.txt
面向智能体的索引文件约定,目前仍无定稿规范。
校准研究
除了大家主动请求的分析之外,我们还测量了一批自选样本,用来校准方法论的阈值。这些数字就来自那里,并且单独公布,因为网站是我们自己挑的,而这会改变数据的含义。
321 个域名,来自西班牙、英国、美国和欧洲其他地区,涵盖品牌、服务和中型企业,于 2026年8月4日 用方法论 0.7.0 · 阈值暂定 测量。数字是在能够完整测完的 226 个域名上计算的。
有 51 个进不去:它们的防火墙中断了分析。这占到有所响应的尝试的 18 %。另有 41 个没有响应,或者没有可分析的内容。
61
样本平均分
样本的分数是怎么分布的?
这批样本是逐个行业手工挑出来的,所以这个分布描述的是这一组网站,而不是别的任何一组。它不是整个网络的写照,而是我们为了校准而挑出来的那些网站的写照——这两件事相差不小,值得分清楚。
- 就绪 — 没有结构性障碍
- 9 · 4%
- 可引用但有缺口 — 能用,只是有几处明确的盲区
- 124 · 55%
- 部分可读 — 它们能找到你,但无法可靠地引用你
- 80 · 35%
- 不可引用 — 各模型无法把这个网站当作来源
- 13 · 6%
最容易不通过的
各项检查中未通过网站的比例,只统计能够测量的那些。旁边是落在这个比例里的网站数量。
- 对引用你的爬虫所声明的立场
- 97% · 215/222
- Markdown 的内容协商
- 96% · 217/226
- 每个标题之后的直接回答
- 95% · 194/204
- 结构化的常见问题
- 94% · 212/226
- 已声明实体类型与业务类型
- 91% · 206/226
- 用于发现的 Link 响应头
- 85% · 192/226
- llms.txt 文件
- 82% · 182/222
- 脱离上下文仍站得住的段落
- 66% · 149/226
样本里几乎所有网站都做到了什么?
这些是几乎没有网站不通过的检查。它们是上面那份清单的配重:如果只公布失败的部分,画出来的图景会比现实更黑,而一套只展示坏消息的方法论,就太像一份销售说辞了。
- 爬虫没有被拦截
- 100% · 226/226
- 首字节时间
- 95% · 215/226
- 引用你的爬虫没有被屏蔽
- 94% · 209/222
- robots.txt 可访问且可解析
- 91% · 202/222
- 给机器人和给人的内容一致
- 88% · 172/195
- 品牌名称的一致性
- 85% · 160/188
- 可辨认的公司或作者页面
- 80% · 181/226
- 干净的跳转链路
- 79% · 179/226
样本是逐个行业手工挑出来的,因此并不代表整个网络:它描述的是这一批网站,不是别的。域名清单已在项目仓库中公布,且没有任何域名在这里连同分数一起出现。