TDMRep
TDMRep —il TDM Reservation Protocol— è un protocollo web per dichiarare se ti riservi i diritti sull’estrazione di testo e dati dai tuoi contenuti, pubblicato come file JSON a un indirizzo fisso del tuo dominio.
Risponde a una domanda diversa da quella del robots.txt. Il robots.txt dice chi può scaricare una pagina; TDMRep dice che cosa se ne può fare legalmente una volta scaricata. Si confondono spesso, e non sono lo stesso permesso.
Che cosa dichiara esattamente TDMRep?
Un file a «/.well-known/tdmrep.json» con due proprietà, e questo è tutto il protocollo. Il suo stesso abstract lo definisce «un protocollo web semplice e pratico, capace di esprimere la riserva di diritti relativa all’estrazione di testo e dati applicata a contenuti web lecitamente accessibili».
- `tdm-reservation` — un booleano. Se ti riservi i diritti sull’estrazione di quei contenuti.
- `tdm-policy` — un URL con le condizioni alle quali l’estrazione è licenziata, se lo è.
- L’indirizzo segue la RFC 8615, la norma che riserva `/.well-known/` a dichiarazioni di questo tipo.
TDMRep è uno standard del W3C?
No, e la specifica lo dice di sé a lettere chiare: «Questa specifica è stata pubblicata dal Text and Data Mining Reservation Protocol Community Group. Non è uno standard del W3C né si trova sul W3C Standards Track».
È un Final Community Group Report, pubblicato il 10 maggio 2024. Un documento reale e concluso, prodotto da un gruppo di lavoro aperto, e non è la stessa cosa di una W3C Recommendation. Quasi tutti quelli che lo citano sbagliano proprio qui.
Perché un sito dovrebbe pubblicarlo?
Il motivo è giuridico prima che tecnico. L’articolo 4 della direttiva europea sul diritto d’autore nel mercato unico digitale permette ai titolari di riservarsi l’estrazione di testo e dati, e riservarsela richiede esprimere quella riserva in forma leggibile da una macchina. TDMRep è un tentativo di formato.
Che venga rispettata è un’altra questione rispetto al fatto che venga espressa, e qui serve onestà: dichiarare una riserva non è imporla. Trattalo come una presa di posizione, non come un blocco tecnico.
Nota lo scarto: la direttiva europea a cui risponde è del 2019 e questo formato è arrivato nel 2024, 5 anni dopo. Un diritto che non puoi esprimere in una forma leggibile dalle macchine è un diritto difficile da esercitare su scala web.
Su che cosa si regge questo?
La specifica stessa, la norma che governa il suo indirizzo, e la documentazione che mostra perché scaricare e usare sono due domande.
- TDM Reservation Protocol, rapporto finale di un Community Group del W3C
La fonte primaria, pubblicata il 10 maggio 2024. Entrambe le citazioni sopra vengono da lì, compresa quella in cui dichiara di non essere uno standard del W3C.
- RFC 8615, Well-Known Uniform Resource Identifiers
La norma che riserva `/.well-known/` e che dà legittimità a un indirizzo come questo.
- Documentazione dei crawler di OpenAI
Mostra l’altra metà del quadro: quale bot scarica per addestrare e quale per rispondere. Accesso e uso si governano separatamente, e TDMRep parla solo dell’uso.
Domande frequenti su TDMRep
TDMRep è come bloccare i crawler di IA?
- No. Bloccare un crawler nel robots.txt gli impedisce di scaricare la pagina. TDMRep dichiara che cosa si può fare legalmente con contenuti scaricati lecitamente. Un sito può permettere tutti i crawler e riservarsi comunque l’estrazione, e quella combinazione è coerente, non contraddittoria.
Pubblicare TDMRep impedisce che i miei contenuti finiscano nell’addestramento?
- Dichiara una riserva; non la impone. Che un dato operatore la rispetti dipende da quell’operatore e, in ultima istanza, dalla giurisdizione. Pubblicarlo mette agli atti la tua posizione in forma leggibile da una macchina, che è quello che chiede la disposizione europea cui risponde.