Testador de Acesso de Bots de IA
Descubra quais crawlers de IA seu robots.txt bloqueia. Testa GPTBot, ClaudeBot, Google-Extended, PerplexityBot, CCBot e mais 28 contra um robots.txt colado, usando a precedência do RFC 9309, agrupados conforme o bot treina modelos, alimenta buscas de IA ou acessa em nome do usuário — e gera um bloco pronto para colar para os que continuam permitidos.
Entrada
Cole o robots.txt que você quer verificar — o seu, ou o que você está prestes a implantar.
Um caminho como /blog/post, ou uma URL completa (apenas o caminho e a query são usados).
Saída
| Crawler | Operador | Finalidade | Acesso | Regra decisiva |
|---|---|---|---|---|
| No data yet | ||||
Os acessos acionados pelo usuário acontecem porque alguém colou seu link num chatbot. Vários operadores afirmam que eles ignoram o robots.txt, então trate um resultado “Blocked” aí como um pedido, e não como uma garantia — reforce na edge se isso for importante.
Bloqueie o restante
Guias
Cole um robots.txt e veja, em uma única tabela, quais crawlers de IA ele realmente bloqueia. A ferramenta testa 33 user-agents de IA documentados — GPTBot, ClaudeBot, Google-Extended, PerplexityBot, CCBot, Bytespider, Applebot-Extended e demais — contra um caminho que você escolhe, usando as mesmas regras de precedência do RFC 9309 que um crawler real aplica.
Como usar
- Cole seu robots.txt na primeira caixa. Ele ainda não precisa estar em produção — verificar um arquivo antes de implantá-lo é exatamente o objetivo.
- Defina o caminho que você quer verificar.
/responde "meu site inteiro está aberto para a IA?";/blog/some-postresponde para uma única página, o que importa quando suas regras usam curingas. - Opcionalmente, restrinja a lista a um propósito — treinamento, busca de IA ou acionado pelo usuário.
- Leia a coluna Regra que decide. Ela indica a diretiva exata e o número da linha que produziu cada veredito, de modo que um resultado surpreendente seja rastreável em vez de misterioso.
- Copie o bloco gerado na parte inferior para bloquear todos os crawlers que ainda estão permitidos.
Os três tipos de crawler de IA
Eles são listados separadamente porque bloqueá-los são três decisões diferentes:
- Treinamento de modelos — coleta páginas para treinar ou ajustar modelos (GPTBot, ClaudeBot, CCBot, Google-Extended). Bloqueá-los é uma opção de não participar dos corpora de treinamento e não custa nada para você na busca.
- Busca de IA — indexa páginas para que um mecanismo de respostas possa citá-las (OAI-SearchBot, PerplexityBot, Claude-SearchBot, DuckAssistBot). Bloqueá-los remove você das respostas de IA — geralmente o oposto do que um dono de site quer.
- Acionado pelo usuário — busca uma única página porque uma pessoa colou seu link em um chatbot (ChatGPT-User, Claude-User, Perplexity-User). Bloqueá-los quebra um link para um visitante real.
Um Disallow: / genérico apontado para "IA" atinge os três. É por isso que a ferramenta os separa.
Por que o Googlebot não está na lista?
Porque bloqueá-lo remove você do Google Search, e não apenas das respostas de IA. O mesmo vale para o bingbot. A opção de não participação no treinamento de IA do Google é o token separado Google-Extended, que está na lista — é ele que você deve bloquear se quiser busca normal, mas não treinamento de modelos.
Bloquear um bot no robots.txt realmente o impede?
Para os crawlers bem-comportados, sim — os principais operadores publicam seus tokens justamente para que você possa optar por não participar. Para os buscadores acionados pelo usuário, vários operadores afirmam claramente que uma busca iniciada por uma pessoa não é um crawl e não consulta o robots.txt. Se você precisa de aplicação e não apenas de um pedido, bloqueie por user-agent ou faixa de IP no seu CDN ou servidor web.
Por que colar o arquivo em vez de informar um domínio?
Para que tudo aconteça inteiramente no seu navegador. Nada é enviado, não há limite de requisições e funciona com um arquivo rascunho que ainda não está implantado em lugar nenhum.
Ferramentas relacionadas
Para testar um crawler específico contra um caminho com a lista completa de regras aplicáveis, use o Testador de Robots.txt. Para criar um robots.txt do zero em vez de auditar um, use o Gerador de Robots.txt. Se você está verificando a configuração de crawl de um site de forma mais ampla, o Gerador de XML Sitemap cobre a outra metade do arquivo que os crawlers procuram.
Use it from code
From 3 credits per callREST API
curl -X POST https://api.iotools.cloud/v1/tool/ai-bot-access-tester \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"robots": "User-agent: *\nDisallow: /admin/\n\nUser-agent: GPT…",
"testUrl": "/",
"purpose": "all"
}'Swap in your own key from your account. The tool's fields are the body — no wrapper.
Ask an AI agent
Use the IOTools `ai-bot-access-tester` tool (AI Bot Access Tester) on this input:
YOUR_INPUT_HEREPaste this at any agent connected to the IOTools MCP server, then add your input.