Два самых старых файла технического SEO — robots.txt и sitemap.xml — обросли ритуалами, как ни одна другая часть дисциплины. Их копируют с чужих сайтов, «настраивают» генераторами приоритетов, используют как замок для чувствительных данных и торжественно прописывают директивы, которые поисковики игнорируют уже лет десять.
Я руковожу SEO-агентством и регулярно смотрю чужие сайты на аудитах. Ниже — разбор самых живучих карго-культов вокруг этих двух файлов: что в них правда, что — ритуал, и как эти файлы работают на самом деле. С реальными случаями, включая сайт, который «продвигали» несколько месяцев при полностью закрытом от индексации домене.
Культ №1. «Робот сам разберётся, карта не нужна»
Совет «sitemap не нужен, робот и так ходит по ссылкам» кочует по форумам с нулевых. Как многие карго-культы, он вырос из правды: на сайте в 20–30 страниц карта действительно ничего не решает — робот обойдёт всё по внутренним ссылкам.
Проблема начинается с масштабом, и называется она краулинговый бюджет: у робота есть лимит страниц, которые он готов обойти на вашем сайте за визит. Когда у вас 10–20 тысяч URL — а у среднего интернет-магазина легко больше, — робот физически не обходит всё подряд. Без карты новые и изменённые страницы он может искать неделями: блуждает по ссылочному графу вместо работы по списку.
Карта переворачивает процесс: робот видит, какие страницы изменились со времени прошлого визита (поле lastmod), и тратит лимит на них, а не на переобход того, что не менялось годами. Для магазинов с обновляющимся ассортиментом и новостных разделов это прямой рычаг скорости индексации.
Отдельный практический приём — не держать карту одним файлом. Разделите её по разделам: карта каталога, карта блога, карта услуг, сверху sitemap index. Кроме порядка это даёт диагностику: в Google Search Console каждая карта видна отдельной строкой со своей статистикой, и просевший по индексации раздел находится за минуту. С одной общей картой на 30 000 ссылок такой картины не получить.
Культ №2. Priority и changefreq
Самый чистый карго-культ из всех: в стандарте sitemap есть поля priority (важность страницы от 0.0 до 1.0) и changefreq (частота изменения), и вокруг них до сих пор живёт целая индустрия ритуалов. Генераторы карт предлагают «расставить приоритеты», SEO-чек-листы требуют «поднять важные страницы до 1.0».
Google в официальной документации прямо пишет: значения priority и changefreq игнорируются. Яндекс формально поля поддерживает, но строить на них что-либо бессмысленно — робот опирается на собственные данные о том, что и как часто меняется.
Единственное поле, которое действительно работает, — lastmod. И у него есть условие: Google использует дату, «если значение гарантированно точное». Здесь прячется анти-паттерн, который убивает пользу поля целиком: CMS, проставляющая всем страницам текущую дату при каждой пересборке карты. Поисковик быстро понимает, что «все страницы обновлены сегодня» — шум, и перестаёт доверять полю вообще. Честный lastmod — свежая дата только у реально изменённых страниц — это то немногое в sitemap, что стоит настроить руками.
<url> <loc>https://site.ru/uslugi/seo-prodvizhenie/</loc> <lastmod>2026-08-01</lastmod> <!-- priority и changefreq можно не писать: Google их игнорирует --></url>
Культ №3. Дефолтный robots.txt, скопированный навсегда
Типовой жизненный цикл robots.txt на коммерческом сайте: при запуске скопировали «стандартный для WordPress/Битрикса», и дальше файл не трогали годами. Это ритуал «файл должен существовать» — без понимания, что файл должен делать.
Меня бесит, когда роботс просто копируют дефолтный — и никто не настраивает его под изменения сайта. А сайт — это живой, развивающийся организм. Появляются новые разделы, которые не должны индексироваться, — их никто не закрывает, и они индексируются. Люди настраивают роботс один раз и забивают на него.
Что при этом попадает в индекс — две классики жанра. Первая: открытый поиск по сайту. Человек заходит в поиск магазина и пишет «купить холодильник», «купить телефон» — каждый запрос генерирует URL вида /search?q=…, и поисковые роботы всё это индексируют, тратя краулинговый бюджет на бесконечный мусор. Вторая: незакрытые GET-параметры. Каждая рекламная ссылка с UTM-меткой — для робота отдельный URL с тем же содержимым, то есть дубль. Если на сайте крутится Яндекс Директ, счёт таких страниц идёт на миллионы.
Рабочий процесс против этого культа — не «настроить правильно один раз», а регулярная сверка файла с реальным поведением робота: в Яндекс Вебмастере — «Статистика обхода», в GSC — отчёт о статусе индексирования. Новые URL, которых вы не ждали, — сигнал обновить правила. Эффект измерим: после нормальной настройки из индекса выпадают сотни и тысячи мусорных страниц, а робот начинает обходить то, что действительно важно.
User-agent: *Disallow: /admin/Disallow: /cart/Disallow: /search/Disallow: /*?utm_Sitemap: https://site.ru/sitemap.xml
Для Яндекса к маскам стоит добавить Clean-param — директиву, склеивающую дубли с GET-параметрами. Google её не читает: для него параметры закрываются масками Disallow.
Культ №4. «Disallow — и страница исчезнет из поиска»
Самое распространённое заблуждение, на котором ошибаются даже SEO-специалисты со стажем: считать robots.txt инструментом управления индексацией. Это не так, и разница принципиальна.
Robots.txt управляет обходом, а не индексацией. Disallow говорит роботу «не заходи на эту страницу» — но не запрещает поисковику знать о её существовании. Если на закрытую страницу ведут ссылки, Google может показать её в выдаче без содержимого — в Search Console это отдельный статус «Проиндексировано, несмотря на блокировку в файле robots.txt».
Гарантированный запрет индексации — метатег noindex. Робот заходит на страницу, видит тег — и не берёт её в индекс.
И здесь спрятана ловушка, в которую попадают, пытаясь «закрыть понадёжнее»: noindex работает только на страницах, открытых в robots. Чтобы увидеть тег, робот должен зайти на страницу. Закрыли её в robots.txt и поставили noindex? Робот не зайдёт, тег не увидит, а страница может остаться в выдаче по внешним ссылкам. Пояс и подтяжки одновременно здесь не работают: для гарантированной невидимости — noindex при открытом обходе.
Культ №5. «Спрячем это в robots.txt»
Robots.txt — публичный файл. Любой человек открывает site.ru/robots.txt и читает список ваших «закрытых» разделов — по сути, аннотированную карту всего, что вы прячете. Использовать его как средство защиты данных — карго-культ с прямым ущербом.
Рынок выучил этот урок дорого: летом 2011-го в выдаче Яндекса массово оказались страницы статусов заказов интернет-магазинов — с именами, адресами и составом покупок, следом — СМС с сайта оператора. Служебные страницы просто никто не закрыл, а авторизации на них не было. С тех пор правило звучит так: пароли, заказы, личные кабинеты защищает только авторизация. Поисковые директивы — про видимость в поиске, не про доступ.
Культ №6. «Настроили при запуске — работает до сих пор»
Sitemap этот культ касается не меньше, чем robots. Карту сделали при запуске сайта, с тех пор появились сотни страниц, старые удалились — а робот продолжает получать список двухлетней давности. На аудитах это выглядит одинаково: битые карты, мусорные URL, sitemap, который не обновлялся никогда, — сплошь и рядом.
Отдельная ошибка — 404-е в карте. Страницу удалили, из карты не убрали: робот тратит краулинговый бюджет на мёртвые адреса, а поисковик видит сайт, который сам зовёт его на несуществующие страницы. В карте должны быть только живые URL: код 200, открытые для индексации, канонические. Никаких редиректов, дублей с параметрами и служебных разделов.
Решение одно — карта обязана пересобираться автоматически. В WordPress это делают Yoast или Rank Math, в Битриксе — модуль «Поисковая оптимизация» с автообновлением при изменении инфоблоков, в статических генераторах — сборка карты на каждом деплое. Если у вас самопис и карта собирается кроном раз в месяц — вы уже в группе риска.
Культ №7 — свежий: «закроем AI-ботов, они воруют контент»
Новый слой правил последних лет — краулеры нейросетей: GPTBot, ClaudeBot, PerplexityBot, боты Яндекса для Алисы. И вокруг них уже сложился собственный молодой культ — закрывать всех скопом, «чтобы не парсили».
Для коммерческого сайта это выстрел себе в ногу: закрытый для AI-ботов сайт не попадает в ответы ChatGPT, Алисы и Perplexity — а это растущий канал трафика и упоминаний, который у нас в проектах уже даёт измеримые переходы. Закрывать имеет смысл разве что уникальный платный контент. Мы в агентстве AI-ботов открываем всегда — и даже собрали Chrome-расширение, которое проверяет, не закрыты ли они в robots и насколько сайт в целом читается нейросетями.
Случай вместо заключения
Любимая история с аудитов — про то, чем заканчивается ритуальное отношение к этим двум файлам. Приходит клиент: несколько месяцев «прорабатывали SEO» с подрядчиком — ни заявок, ничего. Открываю базовые вещи: карту сайта, роботс. В robots.txt — Disallow: / для всех роботов. Сайт закрыт от индексации целиком. Наследство разработки: делали на тестовом домене, закрыли, перенесли на боевой — и забыли открыть. Меня это рассмешило и очень расстроило одновременно: человек потерял время и деньги, а исполнители за всё это время ни разу не открыли два текстовых файла.
Проверка занимает тридцать секунд. Если сайт долго «продвигается» без результата — начинайте диагностику с неё, а не с текстов и ссылок.
Чек-лист без ритуалов
Robots.txt:
-
Файл отвечает 200 и в нём нет Disallow: / без уточнений.
-
Закрыты: админка, корзина, кабинет, поиск по сайту, GET-параметры и UTM-дубли; для Яндекса — Clean-param.
-
Чувствительные разделы — за авторизацией, а не «спрятаны» в robots.
-
Страницы, которых не должно быть в поиске, — под noindex и при этом открыты для обхода.
-
Раз в месяц — сверка со «Статистикой обхода» Вебмастера и отчётом индексирования GSC.
-
Указана строка Sitemap с полным адресом карты.
Sitemap.xml:
-
Карта существует, отвечает 200, добавлена в Вебмастер и GSC.
-
В карте только живые страницы: без 404, редиректов, noindex и дублей с параметрами.
-
Новая страница попадает в карту автоматически — проверяется публикацией тестовой.
-
Lastmod честный: свежие даты только у изменённых страниц.
-
Priority и changefreq не заполняются — и никто по этому поводу не переживает.
-
Для сайтов от нескольких тысяч страниц — карты разделены по разделам через sitemap index.
Развёрнутые версии обоих разборов — с настройкой по CMS, директивами и примерами из панелей — в наших гайдах: про robots.txt и про sitemap.xml.
А в комментариях интересно вот что: какие карго-культы технического SEO встречали вы? Подозреваю, семь пунктов — это далеко не полный список.
ссылка на оригинал статьи https://habr.com/ru/articles/1067780/