Robots d’IA
Les robots d’IA sont les agents automatiques qui récupèrent des pages web pour le compte de systèmes d’intelligence artificielle, et ils ne forment pas une seule famille : certains collectent de la matière pour entraîner des modèles, d’autres vont chercher des sources pour répondre à une question posée à l’instant.
Les traiter comme un seul groupe est l’erreur la plus coûteuse de ce domaine, car la règle écrite pour tenir vos contenus hors d’un corpus d’entraînement peut aussi vous retirer des réponses où vous vouliez apparaître.
Quelle différence entre un robot d’entraînement et un robot de réponse ?
OpenAI documente trois robots, et ils font des choses différentes. GPTBot collecte des contenus susceptibles de servir à entraîner des modèles de fondation. OAI-SearchBot existe pour faire apparaître des sites dans les résultats de recherche de ChatGPT. ChatGPT-User visite une page parce qu’une personne vient de poser une question qui l’exige.
Seul le premier a un rapport avec l’entraînement. Les deux autres sont la voie par laquelle on vous cite, et ils se pilotent par des règles distinctes dans votre robots.txt. Les autres éditeurs tracent la même ligne avec leurs propres noms.
Que se passe-t-il si vous bloquez GPTBot ?
Vous tenez vos contenus hors de ce corpus d’entraînement, choix légitime et, pour certains éditeurs, le bon. Ce que vous n’obtenez pas, c’est d’empêcher l’IA de vous citer, car les citations viennent des robots de recherche et de ceux déclenchés par un utilisateur, régis par d’autres règles.
L’erreur inverse est plus fréquente et plus coûteuse : une règle générale qui bloque tout ce qui contient le mot bot, écrite par quelqu’un qui voulait se prémunir de l’entraînement, et qui emporte les robots de réponse. Le site disparaît des réponses et personne ne relie les deux faits.
La version accidentelle, nous la voyons en permanence. Sur les 321 sites de notre propre échantillon de calibration, 51 ont renvoyé un blocage pare-feu avant même la lecture du robots.txt : 16 % de l’échantillon, fermé à un robot dont les règles n’ont jamais pu être énoncées.
Comment les distinguer ?
Trois vérifications, dans cet ordre. Les deux premières prennent quelques minutes, et c’est à la troisième que la plupart des sites découvrent le problème qu’ils ignoraient.
- Lire la documentation publiée par chaque éditeur : tous nomment leurs robots et disent à quoi sert chacun.
- Écrire des règles explicites par agent dans le robots.txt. Un Allow explicite exprime une intention ; une règle absente n’exprime rien.
- Regarder ce que fait votre pare-feu ou votre CDN, car il peut bloquer un robot avant même la lecture du robots.txt, et il ne vous le dira pas.
Sur quoi cela s’appuie-t-il ?
La documentation des éditeurs eux-mêmes et la norme qui régit la lecture des règles. Les trois sont publiques et gratuites.
- Documentation des robots d’OpenAI
Nomme GPTBot, OAI-SearchBot et ChatGPT-User et indique à quoi sert chacun. C’est la preuve publiée la plus claire que l’entraînement et la réponse sont deux métiers distincts.
- RFC 9309, le protocole d’exclusion des robots
Tranche la lecture d’un robots.txt, y compris le fait que le motif le plus long l’emporte et qu’en cas d’égalité Allow gagne. Presque tous les blocages accidentels sont une mauvaise lecture de cela.
- La convention llms.txt
Ce que vous offrez à un agent une fois que vous l’avez laissé entrer. Permission et orientation sont deux problèmes, souvent confondus.
Questions fréquentes sur Robots d’IA
Bloquer GPTBot empêche-t-il l’IA de me citer ?
- Non. GPTBot collecte de la matière d’entraînement, tandis que les citations viennent des robots de recherche et de ceux déclenchés par un utilisateur, qui suivent des règles distinctes. Bloquer l’un sans les autres est une position cohérente : rester hors du corpus d’entraînement et rester disponible comme source.
Faut-il bloquer les robots d’IA ?
- Cela dépend de ce que vous vendez. Si votre activité est le contenu lui-même, le tenir hors d’un corpus d’entraînement se défend. Si votre activité est d’être trouvé, bloquer les robots de réponse vous retire de l’endroit où vos clients posent désormais leurs questions, et la plupart des règles générales le font par accident.