Часы работы пн-пт 9:00 — 18:00
Адрес г. Тула, ул. Некрасова, 7, оф. 315

Реальный доступ ИИ-ботов к сайту

robots.txt может разрешать ИИ-ботов, а файрвол или Cloudflare — блокировать их по User-Agent. Вставьте адрес сайта: мы зайдём на него как GPTBot, ClaudeBot, PerplexityBot, YandexAdditional и сравним ответ с обычным браузером.

Протокол можно не указывать — подставим https://

Заходим на сайт от имени ИИ-ботов — до 20 секунд…

Зачем проверять реальный доступ ИИ-ботов к сайту?

robots.txt — только половина картины

В robots.txt вы указываете пожелания для ботов, но соблюдение доступа обеспечивает сервер. Если на сайте стоит защита от парсинга, Cloudflare или плагин безопасности, ИИ-бот может получать код 403 или страницу с капчей, хотя robots.txt его разрешает. Для владельца сайта это невидимая проблема: браузер показывает страницу, а ChatGPT или Perplexity её не видят.

Какие боты важны для видимости в ИИ

Для попадания в ответы нужны поисковые боты: OAI-SearchBot и ChatGPT-User у OpenAI, PerplexityBot у Perplexity, YandexAdditional у Яндекса для Нейро и Алисы. GPTBot и ClaudeBot собирают данные для обучения моделей: их можно ограничить отдельно, не закрывая поисковых ботов.

Как работает проверка

Инструмент загружает главную страницу обычным браузерным User-Agent и запоминает код ответа и объём текста. Затем повторяет запрос с User-Agent каждого бота и сравнивает результат. Признаки блокировки: коды 401, 403, 429, 503, оборванное соединение, страница проверки браузера или заметно урезанный текст.

Ограничения метода

Мы подставляем User-Agent, но приходим не с IP-адресов ботов. Сайты, которые проверяют подлинность бота по IP, могут отвечать нам иначе, чем настоящему боту. Поэтому «пускает» в результате означает «не блокирует по User-Agent», а не гарантию, что бот посетит сайт.

Что делать с результатом

Если ботов блокирует файрвол, откройте правила для нужных User-Agent и оставьте закрытыми служебные разделы. Правила robots.txt проверьте отдельно инструментом проверки robots.txt для ИИ-краулеров. Настройку доступа, разметки и llms.txt мы можем взять на себя: внедрение Schema.org и llms.txt.

Развернуть все Свернуть

Часто задаваемые вопросы

Чем эта проверка отличается от проверки robots.txt?
Проверка robots.txt читает правила в файле. Эта проверка заходит на сайт от имени ИИ-ботов и смотрит, что сайт им отдаёт на самом деле. Файрвол, WAF или Cloudflare могут блокировать бота по User-Agent даже при разрешающем robots.txt.
Что значит «блокирует» в результате?
Сайт ответил боту кодом 401, 403, 429 или 503, оборвал соединение либо показал страницу проверки браузера или капчу вместо содержимого, тогда как обычному браузеру страница отдаётся нормально.
Можно ли доверять результату на 100%?
Нет, есть ограничение. Мы подставляем User-Agent бота, но приходим не с его IP-адреса. Если сайт проверяет IP-адреса (например, через верификацию ботов в Cloudflare), результат для настоящего бота может отличаться. Инструмент надёжно ловит именно блокировки по User-Agent.
Какие боты проверяются?
GPTBot, OAI-SearchBot и ChatGPT-User (OpenAI), ClaudeBot (Anthropic), PerplexityBot, YandexAdditional (Нейро и Алиса) и Googlebot для сравнения.
Что делать, если бот заблокирован?
Найдите правило, которое режет бота: настройки Cloudflare (Bot Fight Mode, правила WAF), плагины безопасности, конфигурация nginx или Apache. Затем разрешите нужных ботов и оставьте закрытыми только служебные разделы. Мы можем сделать это за вас.

По этой теме

Настроим правила файрвола, Cloudflare и robots.txt так, чтобы нужные ИИ-боты проходили, а лишние были закрыты.

Настройка доступа ИИ-ботов, Schema.org и llms.txt

Предложить улучшение

Есть идея, как сделать этот инструмент лучше? Напишите — рассмотрим и опубликуем после проверки.