Техническая GEO-база
Как ИИ-краулеры видят ваш сайт: GPTBot, ClaudeBot, PerplexityBot и другие
«ИИ-краулер» звучит как единая категория, но за этим термином скрываются два разных по смыслу процесса. Один бот заходит на сайт, чтобы когда-нибудь использовать его содержимое при обучении следующей версии модели. Другой — заходит в момент, когда живой пользователь задал вопрос, и модели прямо сейчас нужен свежий источник для ответа. Разница между ними определяет, что вообще имеет смысл чинить в первую очередь.
Два типа краулеров — и почему их путают
Краулеры для обучения (например, GPTBot) собирают тексты в общий корпус данных — эффект от того, что сайт стал доступен такому боту, проявится нескоро, при выпуске новой версии модели, и то не гарантированно. Краулеры реального времени (например, PerplexityBot, OAI-SearchBot) работают иначе: пользователь пишет запрос, модель решает, что ей нужен внешний источник, и бот обращается к странице здесь и сейчас, чтобы прочитать её и вставить содержимое в ответ. Если такой краулер заблокирован, модель физически не может процитировать страницу в моменте — вне зависимости от того, насколько хорошо она написана.
- Топ-5 доменов — 38%
- Домены 6–10 — 16%
- Все остальные — 46%
Распределение цитирований в Google AI Overviews: топ-5 доменов забирают 38%, топ-10 — 54%. Источник: RankScope, 2026
Это не просто теория: рынок цитирований устроен по принципу «победитель забирает больше», а не как классическая выдача с длинным хвостом. Если краулер, который мог бы прочитать вашу страницу в реальном времени, заблокирован — вы автоматически выбываете из этого списка, независимо от качества контента.
Шесть краулеров, которые стоит знать в 2026 году
Источник: SEOScaleUp, 2026
Самая частая техническая ошибка 2026 года — блокировка этих ботов в robots.txt по умолчанию, без явного разрешения. Многие шаблоны и CMS исторически блокируют «неизвестных» ботов из соображений безопасности или экономии трафика — и делают это до того, как владелец сайта вообще узнал об их существовании.
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: Applebot-Extended
Allow: /
User-agent: Bingbot
Allow: /Как проверить свой сайт за пять минут
- Откройте example.ru/robots.txt вручную и проверьте, нет ли директивы Disallow напротив нужных user-agent — по умолчанию правило действует, даже если про конкретного бота в файле вообще ничего не написано, а общий Disallow: / стоит для User-agent: *
- Запросите страницу с явным указанием user-agent (curl -A "GPTBot" https://example.ru) и убедитесь, что сервер не возвращает отдельную блокировку на уровне firewall или CDN — robots.txt соблюдают только добросовестные боты, но сервер может резать их независимо от файла
- Проверьте логи сервера на обращения от этих user-agent — их отсутствие может означать не блокировку, а то, что краулер пока не нашёл сайт достаточно значимым, чтобы его посетить
Узнайте свою долю цитирований бесплатно
10 промптов, семь моделей, 3 рабочих дня — без договора и обязательств.
Получить бесплатный мини-аудит