robots.txt — только половина картины
В robots.txt вы указываете пожелания для ботов, но соблюдение доступа обеспечивает сервер. Если на сайте стоит защита от парсинга, Cloudflare или плагин безопасности, ИИ-бот может получать код 403 или страницу с капчей, хотя robots.txt его разрешает. Для владельца сайта это невидимая проблема: браузер показывает страницу, а ChatGPT или Perplexity её не видят.
Какие боты важны для видимости в ИИ
Для попадания в ответы нужны поисковые боты: OAI-SearchBot и ChatGPT-User у OpenAI, PerplexityBot у Perplexity, YandexAdditional у Яндекса для Нейро и Алисы. GPTBot и ClaudeBot собирают данные для обучения моделей: их можно ограничить отдельно, не закрывая поисковых ботов.
Как работает проверка
Инструмент загружает главную страницу обычным браузерным User-Agent и запоминает код ответа и объём текста. Затем повторяет запрос с User-Agent каждого бота и сравнивает результат. Признаки блокировки: коды 401, 403, 429, 503, оборванное соединение, страница проверки браузера или заметно урезанный текст.
Ограничения метода
Мы подставляем User-Agent, но приходим не с IP-адресов ботов. Сайты, которые проверяют подлинность бота по IP, могут отвечать нам иначе, чем настоящему боту. Поэтому «пускает» в результате означает «не блокирует по User-Agent», а не гарантию, что бот посетит сайт.
Что делать с результатом
Если ботов блокирует файрвол, откройте правила для нужных User-Agent и оставьте закрытыми служебные разделы. Правила robots.txt проверьте отдельно инструментом проверки robots.txt для ИИ-краулеров. Настройку доступа, разметки и llms.txt мы можем взять на себя: внедрение Schema.org и llms.txt.