人工智能爬虫
人工智能爬虫是代表人工智能系统去抓取网页的自动代理,而它们并不是同一类:有的在收集用于训练模型的材料,有的则是在为此刻正被提出的某个问题去找来源。
把它们当成一类,是这个领域里代价最高的误解。因为你为了不让内容进入训练集而写下的那条规则,同时也可能把你从你本想出现的那些回答里剔除掉。
训练爬虫和回答爬虫有什么区别?
OpenAI 记录了三个机器人,它们做的事并不相同。GPTBot 收集可能用于训练基础模型的内容;OAI-SearchBot 的存在是为了让网站出现在 ChatGPT 的搜索结果里;ChatGPT-User 访问某个页面,是因为有人刚刚问了一个需要它的问题。
只有第一个和训练有关。另外两个才是你被引用的途径,而它们在你的 robots.txt 里由各自独立的规则管辖。其他厂商也用自己的名字划出同样这条线。
屏蔽 GPTBot 会怎样?
你把内容挡在了那个训练语料之外。这是正当的选择,对某些出版方而言也是对的选择。你没有做到的是阻止人工智能引用你,因为引用来自搜索机器人和由用户触发的机器人,它们受另外的规则管辖。
相反方向的错误更常见,也更伤:一条笼统的规则,把名字里带 bot 的统统拦下,写它的人本来只想防训练,结果把回答爬虫一并带走。网站从回答里消失了,而没有人把这两件事联系起来。
无意造成的那种版本,我们天天见。在我们自己的校准样本里,321 个网站中有 51 个在 robots.txt 被读到之前就返回了防火墙拦截:占样本的 16%,对一个还没来得及说明规则的爬虫关上了门。
怎么分辨它们?
三项检查,按这个顺序。前两项只要几分钟,而多数网站是在第三项上,才发现自己本来不知道的问题。
- 读各家厂商公开的文档:它们都写明了自己的机器人叫什么、各自做什么。
- 在 robots.txt 里按代理写出明确规则。一条明确的 Allow 传达的是意图;没有规则则什么也没传达。
- 查一查你的防火墙或 CDN 在做什么,因为它可能在 robots.txt 被读到之前就拦下爬虫,而且不会告诉你。
这些依据是什么?
厂商自己的文档,加上规定这些规则该怎么读的那份标准。三者都公开且免费。
- OpenAI 爬虫文档
写明了 GPTBot、OAI-SearchBot 和 ChatGPT-User 各自的用途。这是训练与回答属于两件不同工作的、最清楚的公开证据。
- RFC 9309,机器人排除协议
厘清 robots.txt 该怎么读,包括最长匹配优先、平局时 Allow 胜出。几乎所有误拦,都是对这一条的误读。
- llms.txt 约定
把代理放进来之后,你拿什么招待它。许可和导引是两个问题,却常被混为一谈。
关于人工智能爬虫的常见问题
屏蔽 GPTBot 能阻止人工智能引用我吗?
- 不能。GPTBot 收集的是训练材料,而引用来自搜索爬虫和由用户触发的爬虫,它们遵循另外的规则。只屏蔽前者而放行后者,是一个自洽的立场:不进入训练语料,同时继续可以被当作来源。
我该屏蔽人工智能爬虫吗?
- 取决于你卖的是什么。如果内容本身就是你的生意,把它挡在训练语料之外站得住脚。如果你的生意是被人找到,屏蔽回答爬虫等于把自己从客户此刻提问的地方移走,而多数笼统规则正是在无意间这么做的。