Полгода назад ко мне постучался один из будущих клиентов с вопросом, почему ChatGPT не знает про его компанию, хотя сайт в топ-3 Google по нужному запросу. Индексация была нормальной, ссылки — тоже. Проблема нашлась за пять минут в логах: в robots.txt висел Disallow: / для всех user-agent, кроме Googlebot и YandexBot. GPTBot, ClaudeBot, PerplexityBot получали 403 ещё на первом запросе. Полгода сайт был невидим для трёх из четырёх крупных AI-поисковиков, и никто об этом не знал — в Search Console и Вебмастере всё выглядело зелёным.
Случай типовой. Проверка индексации показывает, видит ли сайт поисковик. Попадёт ли страница в ответ модели, которая формирует его вместо поисковой выдачи, — вопрос отдельный. Это две разные аудитории ботов, и вторая почти никогда не попадает в стандартный SEO-чеклист.
Почему классический доступ ≠ доступ для ИИ
GoogleBot и YandexBot строят индекс для ранжирования: заходят регулярно, кэшируют страницу. AI-краулеры делятся на два типа с разной механикой.
Первый тип — это краулеры для обучения моделей: GPTBot у OpenAI, ClaudeBot у Anthropic, CCBot у Common Crawl. Собирают массив текста на будущее, заходят реже, результат не виден сразу.
Второй тип краулеров — это краулеры реального времени: OAI-SearchBot, PerplexityBot, ChatGPT-User. Заходят на страницу в момент, когда пользователь задаёт вопрос модели, забирают контент и отдают его для формирования ответа здесь и сейчас. Нет доступа у такого бота — модель либо не найдёт страницу, либо процитирует конкурента с открытым доступом.
Кстати, robots.txt чаще всего правят один раз при запуске сайта. Список актуальных AI-ботов за два года вырос в разы, а старый файл этого не знает.
Кого пускать: список ботов 2026
Рабочий список на конец июля 2026 года, чтобы попадать в ответы ИИ:
-
GPTBot (OpenAI) — сбор данных для обучения моделей.
-
ChatGPT-User — заходит по прямому запросу пользователя внутри диалога с ChatGPT.
-
OAI-SearchBot (OpenAI) — краулер поискового режима ChatGPT, реальное время.
-
ClaudeBot и anthropic-ai (Anthropic) — сбор и обучение моделей Claude.
-
PerplexityBot — основной краулер Perplexity, реальное время.
-
Google-Extended — отдельная директива для использования контента в Gemini и AI Overviews; не путать с обычным GoogleBot.
-
YandexBot и YandexAI — классический индексатор Яндекса и отдельный бот для ответов Алисы AI.
-
GigaChat — краулер Гигачата от Сбера.
-
Applebot-Extended — расширение Applebot для Apple Intelligence.
-
CCBot (Common Crawl) — датасет, на котором обучается часть моделей, включая открытые LLM.
Полные и обновляемые правила по каждому боту публикуют сами компании: OpenAI — GPTBot, Anthropic — ClaudeBot, Google — Google-Extended. Их стоит перепроверять раз в квартал: новые user-agent выходят без громких анонсов.
Запросы простые:
User-agent: GPTBotAllow: /User-agent: PerplexityBotAllow: /User-agent: ClaudeBotAllow: /
Блокировать имеет смысл точечно — закрытые разделы вроде личного кабинета или черновиков. Общий Disallow: / ловит AI-ботов заодно с парсерами-агрегаторами.
Почему Robots.txt — только первый слой
Content-Security-Policy. Слишком широкие блокировки fetch/connect-src на уровне прокси или CDN задевают легитимных ботов. Файл robots.txt может разрешать бота, а WAF — резать его по IP или user-agent отдельным правилом.
JS-рендер без SSR. Часть ботов реального времени не исполняет JavaScript как браузер. Perplexity-User и OAI-SearchBot забирают HTML первого ответа сервера. Если контент подгружается клиентским JS после этого, модель видит пустую страницу или обрезанный каркас — даже при полностью открытом robots.txt.
Бесконечный скролл без прогрессивной загрузки. Карточки, которые подгружаются только по прокрутке через intersection observer и не лежат в исходном HTML или на постраничных URL, бот не увидит дальше первого экрана.
Комбинация этих трёх факторов и создаёт ситуацию из начала статьи: сайт в индексе Google и Яндекса (эти боты умеют рендерить JS, терпеливее к CSP), но невидим для более простых ботов реального времени.
Переименование, которое легко пропустить
В 2026 году Google переименовала user-agent NotebookLM в Google-GeminiNotebook — об этом писал Search Engine Land в разборе изменений списка краулеров Google. У кого правила в robots.txt, WAF или аналитике по user-agent жёстко зашиты под старое имя NotebookLM, строки перестали срабатывать: правило существует в файле, но адресовано боту, которого больше нет под этим именем.
Если такое упоминание есть в вашем robots.txt или конфиге фаервола, строку нужно продублировать или переписать на Google-GeminiNotebook до конца лета 2026 года.
Как проверить свой сайт
Логи сервера по user-agent. grep по access-логам за две недели даёт список ботов, которые реально заходили, и коды ответов. 403 или редирект на страницу логина — сигнал проблемы:
grep -E "GPTBot|ClaudeBot|PerplexityBot|OAI-SearchBot" access.log | awk '{print $9}' | sort | uniq -c
Тестовый запрос с нужным user-agent. curl с подменой заголовка покажет, что реально отдаёт сервер:
curl -A "GPTBot" -I https://example.com/pagecurl -A "PerplexityBot" https://example.com/page | head -50
Пустой div с классом root без текста в ответе — контент рендерится клиентским JS, это тот самый случай без SSR.
Яндекс.Вебмастер — для YandexBot и YandexAI: показывает, что конкретно видит краулер, включая генеративный контур Алисы. Для остальных ботов встроенного инструмента у площадок нет — только логи и curl.
Три проблемы, с которыми чаще всего стакливаются
-
Готовый шаблон robots.txt из старого проекта. Скопировали файл двухлетней давности, где прописаны боты 2024 года. OAI-SearchBot и Google-Extended вышли позже и в список исключений не попали автоматически.
-
CDN с собственной защитой от ботов. Некоторые CDN по умолчанию включают защиту от парсеров по эвристике на user-agent, и туда попадают легитимные AI-краулеры вместе со спамом. Правило живёт на уровне CDN, а не в robots.txt, поэтому его никто не проверяет при обычном SEO-аудите.
-
Ну раз сайт индексируется, значит, всё в порядке. Индексация в Яндексе и Google ничего не говорит про доступ для GPTBot или PerplexityBot. Это разные проверки, и делать их нужно отдельно.
Проверка robots.txt на актуальный список AI-ботов должна попасть в тот же регулярный аудит, где сейчас лежат проверка индексации и Core Web Vitals. Раз в квартал достаточно. Правка в том случае с сайтом заняла пятнадцать минут — пять строк Allow для основных AI-краулеров, — а динамика цитирований в ChatGPT и Perplexity пошла вверх уже в следующем цикле замера, с лагом в пару недель на переобход.
ссылка на оригинал статьи https://habr.com/ru/articles/1063216/