TDMRep
TDMRep —el TDM Reservation Protocol— es un protocolo web para declarar si te reservas los derechos sobre la minería de textos y datos de tu contenido, publicado como un fichero JSON en una dirección fija de tu dominio.
Responde a una pregunta distinta de la del robots.txt. El robots.txt dice quién puede descargar una página; TDMRep dice qué se puede hacer legalmente con ella una vez descargada. Se confunden a menudo, y no son el mismo permiso.
¿Qué declara exactamente TDMRep?
Un fichero en «/.well-known/tdmrep.json» con dos propiedades, y eso es todo el protocolo. Su propio resumen lo llama «un protocolo web simple y práctico, capaz de expresar la reserva de derechos relativa a la minería de textos y datos aplicada a contenido web legítimamente accesible».
- `tdm-reservation` — un booleano. Si te reservas los derechos sobre la minería de ese contenido.
- `tdm-policy` — una URL con las condiciones bajo las que sí se licencia la minería, si se licencia.
- La dirección sigue la RFC 8615, la norma que reserva `/.well-known/` para declaraciones de este tipo.
¿TDMRep es un estándar del W3C?
No, y la especificación lo dice de sí misma con todas las letras: «Esta especificación fue publicada por el Text and Data Mining Reservation Protocol Community Group. No es un estándar del W3C ni está en la vía de estandarización del W3C».
Es un Final Community Group Report, publicado el 10 de mayo de 2024. Es un documento real y terminado, producido por un grupo de trabajo abierto, y no es lo mismo que una W3C Recommendation. Casi todo el que lo cita se equivoca en esto.
¿Por qué publicaría una web uno de estos?
El motivo es jurídico antes que técnico. El artículo 4 de la directiva europea de derechos de autor en el mercado único digital permite a los titulares reservarse la minería de textos y datos, y reservársela exige expresar esa reserva de forma legible por máquina. TDMRep es un intento de formato.
Que se respete es otra cuestión distinta de que se exprese, y aquí conviene ser honesto: declarar una reserva no es lo mismo que imponerla. Tómalo como fijar una postura, no como un bloqueo técnico.
Fíjate en el desfase: la directiva europea a la que responde es de 2019 y este formato llegó en 2024, 5 años después. Un derecho que no puedes expresar en una forma que lean las máquinas es un derecho difícil de ejercer a escala de la web.
¿De dónde sale esto?
La propia especificación, la norma que gobierna su dirección, y la documentación que enseña por qué permiso de descarga y permiso de uso son dos preguntas.
- TDM Reservation Protocol, informe final de un Community Group del W3C
La fuente primaria, publicada el 10 de mayo de 2024. Las dos citas de arriba salen de ella, incluida aquella en la que declara que no es un estándar del W3C.
- RFC 8615, Well-Known Uniform Resource Identifiers
La norma que reserva `/.well-known/` y que le da legitimidad a una dirección como esta.
- Documentación de los rastreadores de OpenAI
Enseña la otra mitad del cuadro: qué bot descarga para entrenar y cuál para responder. Acceso y uso se gobiernan por separado, y TDMRep solo habla del uso.
Preguntas frecuentes sobre TDMRep
¿TDMRep es lo mismo que bloquear a los rastreadores de IA?
- No. Bloquear un rastreador en el robots.txt impide que descargue la página. TDMRep declara qué se puede hacer legalmente con un contenido que se descargó de forma legítima. Una web puede permitir a todos los rastreadores y aun así reservarse la minería, y esa combinación es coherente, no contradictoria.
¿Publicar TDMRep impide que mi contenido se use para entrenar?
- Declara una reserva; no la impone. Que un operador concreto la respete depende de ese operador y, en último término, de la jurisdicción. Publicarlo deja constancia de tu postura en forma legible por máquina, que es lo que pide la disposición europea a la que responde.