TDMRep
TDMRep —— TDM Reservation Protocol —— 是一项网络协议,用来声明你是否保留对自己内容进行文本与数据挖掘的权利,以 JSON 文件的形式发布在你域名的固定地址上。
它回答的问题和 robots.txt 不同。robots.txt 说的是谁可以抓取一个页面;TDMRep 说的是抓到之后,法律上可以拿它做什么。两者常被混为一谈,而它们并不是同一种许可。
TDMRep 究竟声明了什么?
一个位于「/.well-known/tdmrep.json」的文件,带两个属性,整个协议就这么多。它自己的摘要称之为「一个简单而实用的网络协议,能够表达针对合法可访问的网络内容所作的文本与数据挖掘权利保留」。
- `tdm-reservation` —— 一个布尔值。你是否保留对该内容进行挖掘的权利。
- `tdm-policy` —— 一个网址,指向在何种条件下许可挖掘(如果许可的话)。
- 该地址遵循 RFC 8615,也就是把 `/.well-known/` 留给此类声明的那份标准。
TDMRep 是 W3C 标准吗?
不是,而且规范自己写得清清楚楚:「本规范由 Text and Data Mining Reservation Protocol Community Group 发布。它不是 W3C 标准,也不在 W3C 标准轨道上」。
它是一份 Final Community Group Report,发布于 2024 年 5 月 10 日。这是一份由开放工作组产出的、真实且已完成的文档,但它和 W3C Recommendation 不是一回事。几乎所有引用它的人都在这一点上弄错了。
一个网站为什么要发布它?
动机首先是法律上的,其次才是技术上的。欧盟数字单一市场版权指令第 4 条允许权利人保留文本与数据挖掘,而要保留,就必须以机器可读的方式把这项保留表达出来。TDMRep 是对这种格式的一次尝试。
它是否被尊重,和它是否被表达,是两回事;这里需要诚实:声明一项保留,不等于强制执行它。把它当作表明立场,而不是当作技术上的拦截。
注意这个时间差:它所回应的那部欧盟指令出自 2019 年,而这套格式到 2024 年才出现,整整晚了 5 年。一项无法以机器可读形式表达的权利,在网络规模上是很难行使的。
这些依据是什么?
规范本身、管辖其地址的那份标准,以及说明「抓取」与「使用」为何是两个问题的文档。
- TDM Reservation Protocol,W3C 社区组最终报告
第一手来源,发布于 2024 年 5 月 10 日。上文两处引用都来自它,包括它声明自己不是 W3C 标准的那一句。
- RFC 8615,Well-Known Uniform Resource Identifiers
保留 `/.well-known/` 的那份标准,也是这样一个地址之所以站得住脚的依据。
- OpenAI 爬虫文档
展示了另一半图景:哪个机器人为训练而抓取,哪个为回答而抓取。访问与使用分别受管辖,而 TDMRep 只谈使用。
关于TDMRep的常见问题
TDMRep 和屏蔽人工智能爬虫是一回事吗?
- 不是。在 robots.txt 里屏蔽一个爬虫,阻止的是它抓取页面。TDMRep 声明的是:对合法抓取到的内容,法律上可以做什么。一个网站完全可以放行所有爬虫,同时保留挖掘权利,这种组合是自洽的,并不矛盾。
发布 TDMRep 能阻止我的内容被用于训练吗?
- 它声明一项保留,但不强制执行。某个具体运营方是否尊重它,取决于该运营方,最终取决于司法管辖。发布它,是把你的立场以机器可读的形式记录在案,而这正是它所回应的那条欧盟规定所要求的。