Перейти к основному содержанию

Проверка доступа AI-ботов

Узнайте, каких AI-краулеров блокирует ваш robots.txt. Тестирует GPTBot, ClaudeBot, Google-Extended, PerplexityBot, CCBot и ещё 28 на вставленном robots.txt с учётом приоритета RFC 9309, группируя ботов по тому, обучают ли они модели, питают ли AI-поиск или запрашивают страницы по команде пользователя — и выдаёт готовый блок для тех, кому доступ ещё разрешён.

Ввод

Вставьте robots.txt, который нужно проверить, — свой или тот, который вы собираетесь опубликовать.

Путь вроде /blog/post или полный URL (используются только путь и query).

Вывод

Вердикт по каждому краулеру
КраулерОператорНазначениеДоступРешающее правило
No data yet

Запросы по команде пользователя происходят потому, что кто-то вставил вашу ссылку в чат-бот. Некоторые операторы заявляют, что такие боты игнорируют robots.txt, поэтому относитесь к вердикту «Blocked» здесь как к просьбе, а не к гарантии, — при необходимости применяйте блокировку на edge-уровне.

Заблокировать остальных

Блок в robots.txt для каждого ещё разрешённого краулера
 
Это было полезно?

Руководства

Вставьте robots.txt и увидите в одной таблице, каких ИИ-краулеров он на самом деле блокирует. Инструмент проверяет 33 задокументированных ИИ-агента — GPTBot, ClaudeBot, Google-Extended, PerplexityBot, CCBot, Bytespider, Applebot-Extended и остальных — по выбранному вами пути, используя те же правила приоритета RFC 9309, которые применяет настоящий краулер.

Как использовать

  1. Вставьте ваш robots.txt в первое поле. Он ещё не обязан быть опубликованным — проверить файл до деплоя и есть весь смысл.
  2. Задайте нужный путь. / отвечает на вопрос «весь ли мой сайт открыт для ИИ?»; /blog/some-post отвечает на него для одной страницы, что важно, когда ваши правила используют wildcards.
  3. При желании сузьте список до одной цели — обучение, ИИ-поиск или запрос пользователя.
  4. Прочитайте столбец Решающее правило. В нём указаны точная директива и номер строки, которые дали каждый вердикт, так что неожиданный результат можно отследить, а не гадать.
  5. Скопируйте сгенерированный блок внизу, чтобы запретить доступ каждому краулеру, которому он всё ещё разрешён.

Три типа ИИ-краулеров

Они перечислены отдельно, потому что их блокировка — это три разных решения:

  • Обучение моделей — собирает страницы для обучения или тонкой настройки моделей (GPTBot, ClaudeBot, CCBot, Google-Extended). Блокировка их — это отказ от корпусов для обучения, и она ничего не стоит вам в поиске.
  • ИИ-поиск — индексирует страницы, чтобы поисковый движок ответов мог на них ссылаться (OAI-SearchBot, PerplexityBot, Claude-SearchBot, DuckAssistBot). Их блокировка убирает вас из ответов ИИ — обычно это противоположно тому, чего хочет владелец сайта.
  • Запрос пользователя — забирает одну страницу, потому что человек вставил вашу ссылку в чат-бот (ChatGPT-User, Claude-User, Perplexity-User). Их блокировка ломает ссылку для реального посетителя.

Общий Disallow: /, направленный на «ИИ», задевает все три типа. Именно поэтому инструмент разделяет их.

Почему Googlebot нет в списке?

Потому что его блокировка убирает вас из Google Search, а не только из ответов ИИ. То же касается bingbot. Отказ от обучения ИИ у Google — это отдельный токен Google-Extended, который есть в списке — именно его стоит запретить, если вы хотите обычный поиск, но не обучение моделей.

Действительно ли блокировка бота в robots.txt останавливает его?

Для хорошо ведущих себя краулеров — да: крупные операторы публикуют свои токены именно для того, чтобы вы могли отказаться. Что касается запросов пользователя, некоторые операторы прямо заявляют, что загрузка, инициированная человеком, не является краулингом и не обращается к robots.txt. Если вам нужна не просьба, а принудительное исполнение, блокируйте по user-agent или диапазону IP на вашем CDN или веб-сервере.

Зачем вставлять файл, а не вводить домен?

Чтобы всё выполнялось полностью в вашем браузере. Ничего не загружается, нет лимита запросов, и это работает с черновиком файла, который ещё нигде не опубликован.

Похожие инструменты

Чтобы проверить один конкретный краулер по одному пути со всем списком применимых правил, используйте Тестер robots.txt. Чтобы создать robots.txt с нуля, а не проверять существующий, используйте Генератор robots.txt. Если вы проверяете настройку обхода сайта в целом, Генератор XML-карты сайта покрывает вторую половину файла, который ищут краулеры.

airobots.txtcrawlerseogptbotllm

Use it from code

From 3 credits per call

REST API

curl -X POST https://api.iotools.cloud/v1/tool/ai-bot-access-tester \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "robots": "User-agent: *\nDisallow: /admin/\n\nUser-agent: GPT…",
    "testUrl": "/",
    "purpose": "all"
  }'

Swap in your own key from your account. The tool's fields are the body — no wrapper.

Ask an AI agent

Use the IOTools `ai-bot-access-tester` tool (AI Bot Access Tester) on this input:

YOUR_INPUT_HERE

Paste this at any agent connected to the IOTools MCP server, then add your input.

Нравятся инструменты? Уберите рекламу.

Один платёж навсегда убирает всю рекламу с вашего аккаунта. Без подписки, без слежки.