robots.txt 可访问且可解析
robots_exists
- 检查什么
- 检查 /robots.txt 是否存在、是否返回 200,以及是否含有可识别的指令。
- 怎么检查
- 抓取 https://你的域名/robots.txt,查找「字段: 值」形式的行。返回 200 但内容是 HTML 的,不算 robots.txt。
- 通过阈值
- 返回 200 且至少有一条有效指令即通过。404、服务器错误,或以 200 返回 HTML,均不通过。
- 权重
- 2 (可发现性)
- 为什么这对模型很重要
- robots.txt 是每个爬虫索取的第一个文件。没有它,每个代理都自行决定拿你的网站怎么办,而发布网站的人对这个决定毫无发言权。