Поиск после LLM: почему классической SEO-модели уже недостаточно

от автора

Эта статья не о том, что SEO перестало работать. Она о том, почему архитектура поиска изменилась настолько, что привычной модели «индексация → ранжирование → клик» уже недостаточно для описания происходящего.

На протяжении более двадцати лет веб-поиск был относительно простой системой.
На высоком уровне ее можно представить следующим образом:

Именно под эту модель были построены практически все современные SEO-практики.

Мы оптимизировали:

  • индексацию;

  • внутреннюю перелинковку;

  • сигналы ранжирования;

  • релевантность документа;

  • пользовательские факторы.

Появление больших языковых моделей не отменило эту архитектуру.

Но добавило поверх нее еще один слой.

Что изменилось

Если сильно упростить, современный AI Search выглядит примерно так:

В этой цепочке традиционное ранжирование является лишь одним из возможных источников информации.

Сам ответ строится уже после выбора набора документов.

Именно поэтому первая позиция в поисковой выдаче больше не гарантирует, что информация попадет в итоговый ответ модели.

Retrieval ≠ Ranking

Это ключевое различие.

Ранжирование отвечает на вопрос:

Какой документ показать пользователю первым?

Retrieval отвечает на другой вопрос:

Какие документы использовать для формирования ответа?

Это разные задачи.

Соответственно, разные критерии качества.

Что может происходить внутри Retrieval

Конкретные реализации различаются.

Но в большинстве современных систем можно ожидать комбинацию нескольких механизмов.

Например:

  • BM25;

  • Dense Retrieval;

  • Hybrid Retrieval;

  • Vector Search;

  • Embedding Search;

  • RAG;

  • внутренние Knowledge Graph;

  • внешние поисковые индексы.

При этом сама LLM может вообще не выполнять поиск.

Она получает уже подготовленный набор источников.

Что это означает для SEO

Традиционная задача SEO выглядела так:

Это разные уровни оптимизации.

Документ перестает быть минимальной единицей

Классический поиск работал с документами.

LLM чаще работает с фрагментами знаний.

Например:

  • определением;

  • таблицей;

  • статистикой;

  • инструкцией;

  • процедурой;

  • сравнением;

  • цитатой.

Другими словами, конкурируют уже не только страницы.

Конкурируют отдельные смысловые блоки.

Возможная новая архитектура контента

Если посмотреть на современные публикации глазами Retrieval System, хороший материал постепенно начинает напоминать не длинную статью, а набор независимых knowledge units.

Например:

Такой материал легче:

  • индексировать;

  • разбивать на чанки;

  • эмбеддить;

  • извлекать;

  • цитировать.

Почему появляется новая задача

Сегодня большинство SEO-аудитов отвечает на вопросы:

  • индексируется ли документ;

  • правильно ли работают canonical;

  • есть ли проблемы с robots;

  • какие Core Web Vitals;

  • насколько релевантен Title.

Но практически никто не отвечает на вопросы:

  • насколько хорошо документ разбивается на retrieval chunks;

  • какие сущности содержит материал;

  • легко ли извлекаются определения;

  • насколько самодостаточен каждый смысловой блок;

  • какие части документа могут использоваться без остального текста.

А именно эти вопросы, вероятно, будут становиться все важнее.

Что можно исследовать уже сегодня

Мне кажется интересными несколько направлений.

1. Chunk Architecture

Какой размер блока знаний оптимален?

2. Entity Density

Влияет ли количество и качество сущностей на вероятность использования документа?

3. Citation Probability

Почему AI выбирает один источник, а не другой?

4. Retrieval Score

Можно ли оценить вероятность извлечения документа независимо от его позиции в поисковой выдаче?

5. Cross-LLM Consistency

Используют ли разные модели одни и те же источники?

SEO становится более широким понятием

За последние годы появилось множество новых терминов.

SEO, AEO, GEO, LLMO.

Все они описывают отдельные аспекты происходящих изменений. На мой взгляд, становится полезно смотреть на задачу шире. Не как на оптимизацию поисковой системы. А как на исследование распространения знаний в цифровой среде.

Именно поэтому мне интересен термин Search Intelligence.

Не как маркетинговый ярлык. А как возможное направление исследований на стыке:

  • Information Retrieval;

  • NLP;

  • LLM;

  • Search;

  • Knowledge Management;

  • Information Architecture.

Пока рано говорить о том, что появились новые правила оптимизации.

Индустрия только начинает понимать, как современные AI-системы выбирают источники, извлекают информацию и формируют ответы.

Но уже сейчас можно утверждать одно.

Мы больше не можем описывать поиск исключительно через индексацию, ранжирование и клики.

Появился новый слой — retrieval и синтез знаний.

И, вероятно, именно вокруг него в ближайшие годы будет строиться значительная часть исследований в области поиска.

ссылка на оригинал статьи https://habr.com/ru/articles/1068894/