Rastreadores de IA
Rastreadores de IA são os agentes automáticos que baixam páginas web em nome de sistemas de inteligência artificial, e não são uma família só: uns recolhem material para treinar modelos, outros buscam fontes para responder a uma pergunta que alguém está fazendo agora.
Tratá-los como um grupo único é o erro mais caro desta área, porque a regra que você escreve para manter seu conteúdo fora de um conjunto de treinamento pode também tirar você das respostas onde queria aparecer.
Qual a diferença entre um rastreador de treinamento e um de resposta?
A OpenAI documenta três bots, e eles fazem coisas diferentes. O GPTBot recolhe conteúdo que pode ser usado para treinar modelos de fundação. O OAI-SearchBot existe para que sites apareçam nos resultados de busca do ChatGPT. O ChatGPT-User visita uma página porque uma pessoa acabou de perguntar algo que precisa dela.
Só o primeiro tem a ver com treinamento. Os outros dois são por onde você é citado, e se governam por regras separadas no seu robots.txt. Os demais fabricantes traçam a mesma linha com nomes próprios.
O que acontece se você bloquear o GPTBot?
Você mantém seu conteúdo fora daquele corpus de treinamento, o que é uma escolha legítima e, para alguns veículos, a correta. O que você não consegue é impedir que a IA cite você, porque as citações vêm dos bots de busca e dos disparados por um usuário, que seguem outras regras.
O erro inverso é mais comum e mais danoso: uma regra geral que bloqueia tudo que tenha a palavra bot, escrita por quem queria se proteger do treinamento, levando junto os rastreadores de resposta. O site some das respostas e ninguém liga uma coisa à outra.
A versão acidental a gente vê o tempo todo. Dos 321 sites da nossa própria amostra de calibração, 51 devolveram um bloqueio de firewall antes que alguém chegasse a ler o robots.txt: 16 % da amostra, fechada a um rastreador cujas regras nem chegaram a ser ditas.
Como se distinguem?
Três verificações, nesta ordem. As duas primeiras levam minutos, e é na terceira que a maioria dos sites descobre o problema que não sabia que tinha.
- Ler a documentação publicada por cada fabricante: todos nomeiam seus bots e dizem para que serve cada um.
- Escrever regras explícitas por agente no robots.txt. Um Allow explícito comunica intenção; a ausência de regra não comunica nada.
- Olhar o que o seu firewall ou a sua CDN fazem, porque podem bloquear um rastreador antes mesmo de ele ler o robots.txt, e não vão avisar.
Em que isso se apoia?
A documentação dos próprios fabricantes e a norma que rege como as regras são lidas. As três são públicas e gratuitas.
- Documentação dos rastreadores da OpenAI
Nomeia GPTBot, OAI-SearchBot e ChatGPT-User e diz para que serve cada um. É a evidência publicada mais clara de que treinar e responder são trabalhos separados.
- RFC 9309, o protocolo de exclusão de robôs
Resolve como se lê um robots.txt, incluindo que vence o padrão mais longo e que no empate vence o Allow. Quase todo bloqueio acidental é uma leitura errada disso.
- A convenção llms.txt
O que você oferece a um agente depois de deixá-lo entrar. Permissão e orientação são problemas distintos e costumam ser confundidos.
Perguntas frequentes sobre Rastreadores de IA
Bloquear o GPTBot impede que a IA me cite?
- Não. O GPTBot recolhe material de treinamento, enquanto as citações vêm dos rastreadores de busca e dos disparados por um usuário, que seguem regras separadas. Bloquear um e não os outros é uma posição coerente: ficar fora do corpus de treinamento e continuar disponível como fonte.
Devo bloquear os rastreadores de IA?
- Depende do que você vende. Se o seu negócio é o conteúdo em si, mantê-lo fora de um corpus de treinamento se defende. Se o seu negócio é ser encontrado, bloquear os rastreadores de resposta tira você do lugar onde seus clientes estão perguntando agora, e quase toda regra geral faz isso sem querer.