Primafonte

Crawler di IA

I crawler di IA sono gli agenti automatici che scaricano pagine web per conto di sistemi di intelligenza artificiale, e non sono un’unica famiglia: alcuni raccolgono materiale per addestrare modelli, altri cercano fonti per rispondere a una domanda posta in questo momento.

Trattarli come un gruppo solo è l’errore più caro di questo campo, perché la regola che scrivi per tenere i tuoi contenuti fuori da un corpus di addestramento può anche toglierti dalle risposte in cui volevi comparire.

Che differenza c’è fra un crawler di addestramento e uno di risposta?

OpenAI documenta tre bot, e fanno cose diverse. GPTBot raccoglie contenuti che possono servire ad addestrare modelli fondativi. OAI-SearchBot esiste perché i siti compaiano nei risultati di ricerca di ChatGPT. ChatGPT-User visita una pagina perché una persona ha appena chiesto qualcosa che la richiede.

Solo il primo ha a che fare con l’addestramento. Gli altri due sono la via per cui vieni citato, e si governano con regole separate nel tuo robots.txt. Gli altri produttori tracciano la stessa linea con nomi propri.

Che succede se blocchi GPTBot?

Tieni i tuoi contenuti fuori da quel corpus di addestramento, che è una scelta legittima e per alcuni editori quella giusta. Quello che non ottieni è impedire all’IA di citarti, perché le citazioni arrivano dai bot di ricerca e da quelli attivati da un utente, governati da regole diverse.

L’errore opposto è più comune e più dannoso: una regola generale che blocca tutto ciò che contiene la parola bot, scritta da chi voleva difendersi dall’addestramento, che si porta via anche i crawler di risposta. Il sito sparisce dalle risposte e nessuno collega le due cose.

La versione accidentale la vediamo di continuo. Dei 321 siti del nostro campione di calibrazione, 51 hanno restituito un blocco del firewall prima ancora che qualcuno leggesse il robots.txt: il 16 % del campione, chiuso a un crawler le cui regole non si sono mai potute dire.

Come si distinguono?

Tre verifiche, in quest’ordine. Le prime due richiedono minuti, ed è alla terza che la maggior parte dei siti scopre il problema che non sapeva di avere.

  • Leggere la documentazione pubblicata da ciascun produttore: tutti nominano i propri bot e dicono a che cosa serve ognuno.
  • Scrivere regole esplicite per agente nel robots.txt. Un Allow esplicito comunica intenzione; l’assenza di regola non comunica nulla.
  • Guardare che cosa fa il firewall o la CDN, perché può bloccare un crawler prima ancora che legga il robots.txt, e non te lo dirà.

Su che cosa si regge questo?

La documentazione dei produttori stessi e la norma che regola come si leggono le regole. Tutte e tre pubbliche e gratuite.

  • Documentazione dei crawler di OpenAI

    Nomina GPTBot, OAI-SearchBot e ChatGPT-User e dice a che cosa serve ciascuno. È la prova pubblicata più chiara che addestrare e rispondere sono lavori separati.

  • RFC 9309, il protocollo di esclusione dei robot

    Stabilisce come si legge un robots.txt, compreso che vince il modello più lungo e che a parità vince Allow. Quasi tutti i blocchi accidentali sono una cattiva lettura proprio di questo.

  • La convenzione llms.txt

    Ciò che offri a un agente dopo averlo lasciato entrare. Permesso e orientamento sono due problemi distinti e vengono spesso confusi.

Domande frequenti su Crawler di IA

Bloccare GPTBot impedisce all’IA di citarmi?

No. GPTBot raccoglie materiale di addestramento, mentre le citazioni arrivano dai crawler di ricerca e da quelli attivati da un utente, che seguono regole separate. Bloccare uno e non gli altri è una posizione coerente: restare fuori dal corpus di addestramento e restare disponibile come fonte.

Dovrei bloccare i crawler di IA?

Dipende da che cosa vendi. Se il tuo business è il contenuto in sé, tenerlo fuori da un corpus di addestramento è difendibile. Se il tuo business è farti trovare, bloccare i crawler di risposta ti toglie dal posto in cui i tuoi clienti stanno chiedendo adesso, e quasi tutte le regole generali lo fanno per sbaglio.
Crawler di IA: addestrare o rispondere — Primafonte