TDMRep
TDMRep — o TDM Reservation Protocol — é um protocolo web para declarar se você reserva os direitos sobre a mineração de textos e dados do seu conteúdo, publicado como arquivo JSON num endereço fixo do seu domínio.
Responde a uma pergunta diferente da do robots.txt. O robots.txt diz quem pode baixar uma página; o TDMRep diz o que se pode fazer legalmente com ela depois de baixada. São confundidos com frequência, e não são a mesma permissão.
O que o TDMRep declara exatamente?
Um arquivo em «/.well-known/tdmrep.json» com duas propriedades, e isso é o protocolo inteiro. O próprio resumo o chama de «um protocolo web simples e prático, capaz de expressar a reserva de direitos relativa à mineração de textos e dados aplicada a conteúdo web licitamente acessível».
- `tdm-reservation` — um booleano. Se você reserva os direitos sobre a mineração daquele conteúdo.
- `tdm-policy` — uma URL com as condições sob as quais a mineração é licenciada, se for.
- O endereço segue a RFC 8615, a norma que reserva `/.well-known/` para declarações desse tipo.
O TDMRep é um padrão do W3C?
Não, e a especificação diz isso de si mesma com todas as letras: «Esta especificação foi publicada pelo Text and Data Mining Reservation Protocol Community Group. Não é um padrão do W3C nem está na trilha de padronização do W3C».
É um Final Community Group Report, publicado em 10 de maio de 2024. Um documento real e concluído, produzido por um grupo de trabalho aberto, e não é a mesma coisa que uma W3C Recommendation. Quase todo mundo que o cita erra nisso.
Por que um site publicaria isso?
O motivo é jurídico antes de ser técnico. O artigo 4 da diretiva europeia de direito autoral no mercado único digital permite aos titulares reservar a mineração de textos e dados, e reservá-la exige expressar essa reserva de forma legível por máquina. O TDMRep é uma tentativa de formato.
Que seja respeitada é outra questão, distinta de ser expressa, e aqui cabe honestidade: declarar uma reserva não é impor uma. Encare como fixar uma posição, não como um bloqueio técnico.
Repare na defasagem: a diretiva europeia à qual ele responde é de 2019 e este formato chegou em 2024, 5 anos depois. Um direito que você não consegue expressar de forma legível por máquinas é um direito difícil de exercer na escala da web.
Em que isso se apoia?
A própria especificação, a norma que governa seu endereço, e a documentação que mostra por que baixar e usar são duas perguntas.
- TDM Reservation Protocol, relatório final de um Community Group do W3C
A fonte primária, publicada em 10 de maio de 2024. As duas citações acima vêm dela, inclusive aquela em que declara não ser um padrão do W3C.
- RFC 8615, Well-Known Uniform Resource Identifiers
A norma que reserva `/.well-known/` e dá legitimidade a um endereço como este.
- Documentação dos rastreadores da OpenAI
Mostra a outra metade do quadro: qual bot baixa para treinar e qual para responder. Acesso e uso se governam separadamente, e o TDMRep só fala do uso.
Perguntas frequentes sobre TDMRep
TDMRep é o mesmo que bloquear rastreadores de IA?
- Não. Bloquear um rastreador no robots.txt impede que ele baixe a página. O TDMRep declara o que se pode fazer legalmente com conteúdo baixado licitamente. Um site pode permitir todos os rastreadores e ainda assim reservar a mineração, e essa combinação é coerente, não contraditória.
Publicar TDMRep impede que meu conteúdo seja usado para treinar?
- Declara uma reserva; não a impõe. Se um operador específico a respeita depende dele e, no fim, da jurisdição. Publicá-lo registra sua posição em forma legível por máquina, que é o que pede a disposição europeia à qual ele responde.