Rastreadores de IA
Los rastreadores de IA son los agentes automáticos que descargan páginas web por cuenta de sistemas de inteligencia artificial, y no son una sola familia: unos recogen material para entrenar modelos y otros buscan fuentes para responder una pregunta que alguien está haciendo ahora mismo.
Tratarlos como un solo grupo es el error más caro de este campo, porque la regla que escribes para que tu contenido no acabe en un conjunto de entrenamiento puede sacarte además de las respuestas en las que querías aparecer.
¿Qué diferencia hay entre un rastreador de entrenamiento y uno de respuesta?
OpenAI documenta tres bots y hacen cosas distintas. GPTBot recoge contenido que puede usarse para entrenar modelos fundacionales. OAI-SearchBot existe para que las webs aparezcan en los resultados de búsqueda de ChatGPT. ChatGPT-User visita una página porque una persona acaba de preguntar algo que la necesita.
Solo el primero tiene que ver con el entrenamiento. Los otros dos son por donde te citan, y se gobiernan con reglas separadas en tu robots.txt. Los demás fabricantes trazan la misma línea con sus propios nombres.
¿Qué pasa si bloqueas GPTBot?
Mantienes tu contenido fuera de ese corpus de entrenamiento, que es una decisión legítima y para algunos editores la correcta. Lo que no consigues es impedir que la IA te cite, porque las citas vienen de los bots de búsqueda y de los que dispara un usuario, gobernados por reglas distintas.
El error contrario es más habitual y más dañino: una regla general que bloquea todo lo que lleve la palabra bot, escrita por alguien que quería protegerse del entrenamiento, llevándose por delante a los rastreadores de respuesta. La web desaparece de las respuestas y nadie relaciona las dos cosas.
La versión accidental la vemos constantemente. De las 321 webs de nuestra propia muestra de calibración, 51 devolvieron un bloqueo de cortafuegos antes de que nadie llegara a leer el robots.txt: un 16 % de la muestra, cerrada a un rastreador cuyas reglas no llegaron a decirse.
¿Cómo se distinguen?
Tres comprobaciones, en este orden. Las dos primeras llevan minutos y en la tercera es donde la mayoría de las webs descubre el problema que no sabía que tenía.
- Leer la documentación publicada por cada fabricante: todos nombran sus bots y dicen para qué sirve cada uno.
- Escribir reglas explícitas por agente en el robots.txt. Un Allow explícito comunica intención; la ausencia de regla no comunica nada.
- Mirar qué hace tu cortafuegos o tu CDN, porque puede bloquear a un rastreador antes de que llegue a leer el robots.txt, y no te lo va a decir.
¿Sobre qué se apoya esto?
La documentación de los propios fabricantes y la norma que rige cómo se leen las reglas. Las tres son públicas y gratuitas.
- Documentación de los rastreadores de OpenAI
Nombra GPTBot, OAI-SearchBot y ChatGPT-User y dice para qué sirve cada uno. Es la evidencia publicada más clara de que entrenar y responder son trabajos separados.
- RFC 9309, el protocolo de exclusión de robots
Zanja cómo se lee un robots.txt, incluido que gana el patrón más largo y que en un empate gana Allow. Casi todos los bloqueos accidentales son una mala lectura de esto.
- La convención llms.txt
Lo que le ofreces a un agente una vez que le has dejado entrar. Permiso y orientación son problemas distintos y se confunden a menudo.
Preguntas frecuentes sobre Rastreadores de IA
¿Bloquear GPTBot impide que la IA me cite?
- No. GPTBot recoge material de entrenamiento, mientras que las citas vienen de los rastreadores de búsqueda y de los que dispara un usuario, que siguen reglas separadas. Bloquear uno y no los otros es una postura coherente: quedarse fuera del corpus de entrenamiento y seguir disponible como fuente.
¿Debería bloquear los rastreadores de IA?
- Depende de qué vendas. Si tu negocio es el contenido en sí, mantenerlo fuera de un corpus de entrenamiento es defendible. Si tu negocio es que te encuentren, bloquear los rastreadores de respuesta te saca del sitio donde tus clientes están preguntando ahora, y casi todas las reglas generales hacen eso sin querer.