AI-краулеры в 2026: кого пускать в robots.txt, чтобы попадать в ответы ИИ

от автора

Полгода назад ко мне постучался один из будущих клиентов с вопросом, почему ChatGPT не знает про его компанию, хотя сайт в топ-3 Google по нужному запросу. Индексация была нормальной, ссылки — тоже. Проблема нашлась за пять минут в логах: в robots.txt висел Disallow: / для всех user-agent, кроме Googlebot и YandexBot. GPTBot, ClaudeBot, PerplexityBot получали 403 ещё на первом запросе. Полгода сайт был невидим для трёх из четырёх крупных AI-поисковиков, и никто об этом не знал — в Search Console и Вебмастере всё выглядело зелёным.

Случай типовой. Проверка индексации показывает, видит ли сайт поисковик. Попадёт ли страница в ответ модели, которая формирует его вместо поисковой выдачи, — вопрос отдельный. Это две разные аудитории ботов, и вторая почти никогда не попадает в стандартный SEO-чеклист.

Почему классический доступ ≠ доступ для ИИ

GoogleBot и YandexBot строят индекс для ранжирования: заходят регулярно, кэшируют страницу. AI-краулеры делятся на два типа с разной механикой.

Первый тип — это краулеры для обучения моделей: GPTBot у OpenAI, ClaudeBot у Anthropic, CCBot у Common Crawl. Собирают массив текста на будущее, заходят реже, результат не виден сразу.

Второй тип краулеров — это краулеры реального времени: OAI-SearchBot, PerplexityBot, ChatGPT-User. Заходят на страницу в момент, когда пользователь задаёт вопрос модели, забирают контент и отдают его для формирования ответа здесь и сейчас. Нет доступа у такого бота — модель либо не найдёт страницу, либо процитирует конкурента с открытым доступом.

Кстати, robots.txt чаще всего правят один раз при запуске сайта. Список актуальных AI-ботов за два года вырос в разы, а старый файл этого не знает.

Кого пускать: список ботов 2026

Мой личный набор + то, что настраиваю своим клиентам

Мой личный набор + то, что настраиваю своим клиентам

Рабочий список на конец июля 2026 года, чтобы попадать в ответы ИИ:

  • GPTBot (OpenAI) — сбор данных для обучения моделей.

  • ChatGPT-User — заходит по прямому запросу пользователя внутри диалога с ChatGPT.

  • OAI-SearchBot (OpenAI) — краулер поискового режима ChatGPT, реальное время.

  • ClaudeBot и anthropic-ai (Anthropic) — сбор и обучение моделей Claude.

  • PerplexityBot — основной краулер Perplexity, реальное время.

  • Google-Extended — отдельная директива для использования контента в Gemini и AI Overviews; не путать с обычным GoogleBot.

  • YandexBot и YandexAI — классический индексатор Яндекса и отдельный бот для ответов Алисы AI.

  • GigaChat — краулер Гигачата от Сбера.

  • Applebot-Extended — расширение Applebot для Apple Intelligence.

  • CCBot (Common Crawl) — датасет, на котором обучается часть моделей, включая открытые LLM.

Полные и обновляемые правила по каждому боту публикуют сами компании: OpenAI — GPTBot, Anthropic — ClaudeBot, Google — Google-Extended. Их стоит перепроверять раз в квартал: новые user-agent выходят без громких анонсов.

Запросы простые:

User-agent: GPTBotAllow: /User-agent: PerplexityBotAllow: /User-agent: ClaudeBotAllow: /

Блокировать имеет смысл точечно — закрытые разделы вроде личного кабинета или черновиков. Общий Disallow: / ловит AI-ботов заодно с парсерами-агрегаторами.

Почему Robots.txt — только первый слой

Доступ теряется ещё в трёх местах, и там его теряют чаще, потому что о них не думают в контексте AI

Доступ теряется ещё в трёх местах, и там его теряют чаще, потому что о них не думают в контексте AI

Content-Security-Policy. Слишком широкие блокировки fetch/connect-src на уровне прокси или CDN задевают легитимных ботов. Файл robots.txt может разрешать бота, а WAF — резать его по IP или user-agent отдельным правилом.

JS-рендер без SSR. Часть ботов реального времени не исполняет JavaScript как браузер. Perplexity-User и OAI-SearchBot забирают HTML первого ответа сервера. Если контент подгружается клиентским JS после этого, модель видит пустую страницу или обрезанный каркас — даже при полностью открытом robots.txt.

Бесконечный скролл без прогрессивной загрузки. Карточки, которые подгружаются только по прокрутке через intersection observer и не лежат в исходном HTML или на постраничных URL, бот не увидит дальше первого экрана.

Комбинация этих трёх факторов и создаёт ситуацию из начала статьи: сайт в индексе Google и Яндекса (эти боты умеют рендерить JS, терпеливее к CSP), но невидим для более простых ботов реального времени.

Переименование, которое легко пропустить

В 2026 году Google переименовала user-agent NotebookLM в Google-GeminiNotebook — об этом писал Search Engine Land в разборе изменений списка краулеров Google. У кого правила в robots.txt, WAF или аналитике по user-agent жёстко зашиты под старое имя NotebookLM, строки перестали срабатывать: правило существует в файле, но адресовано боту, которого больше нет под этим именем.

Если такое упоминание есть в вашем robots.txt или конфиге фаервола, строку нужно продублировать или переписать на Google-GeminiNotebook до конца лета 2026 года.

Как проверить свой сайт

Логи сервера по user-agent. grep по access-логам за две недели даёт список ботов, которые реально заходили, и коды ответов. 403 или редирект на страницу логина — сигнал проблемы:

grep -E "GPTBot|ClaudeBot|PerplexityBot|OAI-SearchBot" access.log | awk '{print $9}' | sort | uniq -c

Тестовый запрос с нужным user-agent. curl с подменой заголовка покажет, что реально отдаёт сервер:

curl -A "GPTBot" -I https://example.com/pagecurl -A "PerplexityBot" https://example.com/page | head -50

Пустой div с классом root без текста в ответе — контент рендерится клиентским JS, это тот самый случай без SSR.

Яндекс.Вебмастер — для YandexBot и YandexAI: показывает, что конкретно видит краулер, включая генеративный контур Алисы. Для остальных ботов встроенного инструмента у площадок нет — только логи и curl.

Три проблемы, с которыми чаще всего стакливаются

  1. Готовый шаблон robots.txt из старого проекта. Скопировали файл двухлетней давности, где прописаны боты 2024 года. OAI-SearchBot и Google-Extended вышли позже и в список исключений не попали автоматически.

  2. CDN с собственной защитой от ботов. Некоторые CDN по умолчанию включают защиту от парсеров по эвристике на user-agent, и туда попадают легитимные AI-краулеры вместе со спамом. Правило живёт на уровне CDN, а не в robots.txt, поэтому его никто не проверяет при обычном SEO-аудите.

  3. Ну раз сайт индексируется, значит, всё в порядке. Индексация в Яндексе и Google ничего не говорит про доступ для GPTBot или PerplexityBot. Это разные проверки, и делать их нужно отдельно.

Проверка robots.txt на актуальный список AI-ботов должна попасть в тот же регулярный аудит, где сейчас лежат проверка индексации и Core Web Vitals. Раз в квартал достаточно. Правка в том случае с сайтом заняла пятнадцать минут — пять строк Allow для основных AI-краулеров, — а динамика цитирований в ChatGPT и Perplexity пошла вверх уже в следующем цикле замера, с лагом в пару недель на переобход.

ссылка на оригинал статьи https://habr.com/ru/articles/1063216/