citatoБесплатный аудит
← Все статьи

Техническая GEO-база

Как ИИ-краулеры видят ваш сайт: GPTBot, ClaudeBot, PerplexityBot и другие

7 мин чтения

«ИИ-краулер» звучит как единая категория, но за этим термином скрываются два разных по смыслу процесса. Один бот заходит на сайт, чтобы когда-нибудь использовать его содержимое при обучении следующей версии модели. Другой — заходит в момент, когда живой пользователь задал вопрос, и модели прямо сейчас нужен свежий источник для ответа. Разница между ними определяет, что вообще имеет смысл чинить в первую очередь.

Два типа краулеров — и почему их путают

Краулеры для обучения (например, GPTBot) собирают тексты в общий корпус данных — эффект от того, что сайт стал доступен такому боту, проявится нескоро, при выпуске новой версии модели, и то не гарантированно. Краулеры реального времени (например, PerplexityBot, OAI-SearchBot) работают иначе: пользователь пишет запрос, модель решает, что ей нужен внешний источник, и бот обращается к странице здесь и сейчас, чтобы прочитать её и вставить содержимое в ответ. Если такой краулер заблокирован, модель физически не может процитировать страницу в моменте — вне зависимости от того, насколько хорошо она написана.

  • Топ-5 доменов 38%
  • Домены 6–10 16%
  • Все остальные 46%

Распределение цитирований в Google AI Overviews: топ-5 доменов забирают 38%, топ-10 — 54%. Источник: RankScope, 2026

Это не просто теория: рынок цитирований устроен по принципу «победитель забирает больше», а не как классическая выдача с длинным хвостом. Если краулер, который мог бы прочитать вашу страницу в реальном времени, заблокирован — вы автоматически выбываете из этого списка, независимо от качества контента.

Шесть краулеров, которые стоит знать в 2026 году

GPTBotOpenAI
ClaudeBotAnthropic
PerplexityBotPerplexity
Google-ExtendedGoogle
Applebot-ExtendedApple
BingbotMicrosoft

Источник: SEOScaleUp, 2026

Самая частая техническая ошибка 2026 года — блокировка этих ботов в robots.txt по умолчанию, без явного разрешения. Многие шаблоны и CMS исторически блокируют «неизвестных» ботов из соображений безопасности или экономии трафика — и делают это до того, как владелец сайта вообще узнал об их существовании.

User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: Applebot-Extended
Allow: /

User-agent: Bingbot
Allow: /

Как проверить свой сайт за пять минут

  • Откройте example.ru/robots.txt вручную и проверьте, нет ли директивы Disallow напротив нужных user-agent — по умолчанию правило действует, даже если про конкретного бота в файле вообще ничего не написано, а общий Disallow: / стоит для User-agent: *
  • Запросите страницу с явным указанием user-agent (curl -A "GPTBot" https://example.ru) и убедитесь, что сервер не возвращает отдельную блокировку на уровне firewall или CDN — robots.txt соблюдают только добросовестные боты, но сервер может резать их независимо от файла
  • Проверьте логи сервера на обращения от этих user-agent — их отсутствие может означать не блокировку, а то, что краулер пока не нашёл сайт достаточно значимым, чтобы его посетить
robots.txt — необходимое, но не достаточное условие. Открытый доступ для краулера не делает контент более цитируемым сам по себе: он лишь снимает техническое препятствие, чтобы модель вообще могла его прочитать.