Проверка доступа AI-ботов
Узнайте, каких AI-краулеров блокирует ваш robots.txt. Тестирует GPTBot, ClaudeBot, Google-Extended, PerplexityBot, CCBot и ещё 28 на вставленном robots.txt с учётом приоритета RFC 9309, группируя ботов по тому, обучают ли они модели, питают ли AI-поиск или запрашивают страницы по команде пользователя — и выдаёт готовый блок для тех, кому доступ ещё разрешён.
Ввод
Вставьте robots.txt, который нужно проверить, — свой или тот, который вы собираетесь опубликовать.
Путь вроде /blog/post или полный URL (используются только путь и query).
Вывод
| Краулер | Оператор | Назначение | Доступ | Решающее правило |
|---|---|---|---|---|
| No data yet | ||||
Запросы по команде пользователя происходят потому, что кто-то вставил вашу ссылку в чат-бот. Некоторые операторы заявляют, что такие боты игнорируют robots.txt, поэтому относитесь к вердикту «Blocked» здесь как к просьбе, а не к гарантии, — при необходимости применяйте блокировку на edge-уровне.
Заблокировать остальных
Руководства
Вставьте robots.txt и увидите в одной таблице, каких ИИ-краулеров он на самом деле блокирует. Инструмент проверяет 33 задокументированных ИИ-агента — GPTBot, ClaudeBot, Google-Extended, PerplexityBot, CCBot, Bytespider, Applebot-Extended и остальных — по выбранному вами пути, используя те же правила приоритета RFC 9309, которые применяет настоящий краулер.
Как использовать
- Вставьте ваш robots.txt в первое поле. Он ещё не обязан быть опубликованным — проверить файл до деплоя и есть весь смысл.
- Задайте нужный путь.
/отвечает на вопрос «весь ли мой сайт открыт для ИИ?»;/blog/some-postотвечает на него для одной страницы, что важно, когда ваши правила используют wildcards. - При желании сузьте список до одной цели — обучение, ИИ-поиск или запрос пользователя.
- Прочитайте столбец Решающее правило. В нём указаны точная директива и номер строки, которые дали каждый вердикт, так что неожиданный результат можно отследить, а не гадать.
- Скопируйте сгенерированный блок внизу, чтобы запретить доступ каждому краулеру, которому он всё ещё разрешён.
Три типа ИИ-краулеров
Они перечислены отдельно, потому что их блокировка — это три разных решения:
- Обучение моделей — собирает страницы для обучения или тонкой настройки моделей (GPTBot, ClaudeBot, CCBot, Google-Extended). Блокировка их — это отказ от корпусов для обучения, и она ничего не стоит вам в поиске.
- ИИ-поиск — индексирует страницы, чтобы поисковый движок ответов мог на них ссылаться (OAI-SearchBot, PerplexityBot, Claude-SearchBot, DuckAssistBot). Их блокировка убирает вас из ответов ИИ — обычно это противоположно тому, чего хочет владелец сайта.
- Запрос пользователя — забирает одну страницу, потому что человек вставил вашу ссылку в чат-бот (ChatGPT-User, Claude-User, Perplexity-User). Их блокировка ломает ссылку для реального посетителя.
Общий Disallow: /, направленный на «ИИ», задевает все три типа. Именно поэтому инструмент разделяет их.
Почему Googlebot нет в списке?
Потому что его блокировка убирает вас из Google Search, а не только из ответов ИИ. То же касается bingbot. Отказ от обучения ИИ у Google — это отдельный токен Google-Extended, который есть в списке — именно его стоит запретить, если вы хотите обычный поиск, но не обучение моделей.
Действительно ли блокировка бота в robots.txt останавливает его?
Для хорошо ведущих себя краулеров — да: крупные операторы публикуют свои токены именно для того, чтобы вы могли отказаться. Что касается запросов пользователя, некоторые операторы прямо заявляют, что загрузка, инициированная человеком, не является краулингом и не обращается к robots.txt. Если вам нужна не просьба, а принудительное исполнение, блокируйте по user-agent или диапазону IP на вашем CDN или веб-сервере.
Зачем вставлять файл, а не вводить домен?
Чтобы всё выполнялось полностью в вашем браузере. Ничего не загружается, нет лимита запросов, и это работает с черновиком файла, который ещё нигде не опубликован.
Похожие инструменты
Чтобы проверить один конкретный краулер по одному пути со всем списком применимых правил, используйте Тестер robots.txt. Чтобы создать robots.txt с нуля, а не проверять существующий, используйте Генератор robots.txt. Если вы проверяете настройку обхода сайта в целом, Генератор XML-карты сайта покрывает вторую половину файла, который ищут краулеры.
Use it from code
From 3 credits per callREST API
curl -X POST https://api.iotools.cloud/v1/tool/ai-bot-access-tester \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"robots": "User-agent: *\nDisallow: /admin/\n\nUser-agent: GPT…",
"testUrl": "/",
"purpose": "all"
}'Swap in your own key from your account. The tool's fields are the body — no wrapper.
Ask an AI agent
Use the IOTools `ai-bot-access-tester` tool (AI Bot Access Tester) on this input:
YOUR_INPUT_HEREPaste this at any agent connected to the IOTools MCP server, then add your input.