Внутри Labrador: Секретная поисковая архитектура OpenAI и собственный индекс ChatGPT

от автора

Долгое время в индустрии поисковой оптимизации существовало мнение, что ChatGPT не имеет собственной поисковой базы и полностью полагается на выдачу внешних поисковиков вроде Google и Bing. Однако технический анализ внутренней структуры сервиса показывает обратное: OpenAI тайно разработала и развивает собственное семейство поисковых индексов, постепенно сокращая зависимость от сторонних провайдеров.

Семейство вертикальных индексов Labrador

Внутреннее кодовое название поискового индекса OpenAI — Labrador. Это не единая монолитная база данных, а целый комплекс специализированных (вертикальных) индексов, настроенных под конкретные типы контента:

  • Общий веб (General web)

  • PDF-документы

  • YouTube

  • Новости (News) — с разделением на временные слои: данные за последние 24 часа, за последние 7 дней и архивные материалы

  • arXiv (академические и научные публикации)

  • Wikipedia

  • Локальный поиск (Local)

  • Финансы (включая обособленный индекс для обработки финансовых PDF-файлов)

  • Юриспруденция (Legal)

  • Медицина (Medical)

  • Товары (Shopping)

  • Изображения

В индексе Labrador хранится стандартный для поисковых систем набор данных: полные тексты веб-страниц, даты их обхода поисковым роботом и даты публикации материалов.

Таким образом, OpenAI воспроизвела архитектуру, которую Google выстраивал десятилетиями: базовый веб-индекс в сочетании с узкоспециализированными вертикальными базами данных в виде RAG.

Евгений Молдовану

Senior seo специалист, специализация по GEO и AI поиск

Хотя в исходной статье нет об этом информации, на личном опыте также зафиксировал обращение к наборам данных Линкедина и UpWork. Поэтому список использованных наборов может быть намного больше, похоже ChatGPT заключает отдельные договора с крупными сайтами.

Откуда информация о существовании Labrador ?

Существование Labrador подтверждается рядом жестких инфраструктурных и программных факторов:

  • Серверный след (SSE-данные): В период с 21 мая по 21 июля 2026 года в потоке данных серверных событий (Server-Side Events) ChatGPT открыто передавалось техническое поле result_source. Оно принимало всего четыре значения: три из них принадлежали сторонним краулерам (Bright, Oxylabs, SERP), а четвертым неизменно значился Labrador — собственный индекс OpenAI.

  • Агрессивный краулинг и кэширование: Живой поиск в реальном времени слишком медленен для масштабов ChatGPT — по статистике, более 58% веб-страниц загружаются дольше 0,8 секунды. Чтобы обеспечить мгновенный отклик, OpenAI кэширует страницы. В рамках независимого эксперимента был запущен тестовый сайт объемом 1 миллиард страниц. Поисковый робот OpenAI мгновенно начал его обход со скоростью 35 000 запросов в час, обработав более 6 миллионов страниц к началу сентября 2026 года.

  • Проверка режима изоляции (Lockdown Mode): При отключении функции живого поиска в настройках ChatGPT (переходе в автономный режим) модель все равно продолжает выдавать точные копии главных страниц крупнейших профильных изданий. Это доказывает, что данные извлекаются напрямую из внутреннего кэша OpenAI.

  • Эксабайтный масштаб в вакансиях: В описаниях вакансий OpenAI для инженеров поисковых систем прямо указываются требования по работе с базами данных эксабайтного масштаба (10^18 байт) в распределенных облачных средах. Также от специалистов требуют опыта в гибридном поиске — объединении традиционного текстового поиска (алгоритм BM25) и векторного поиска по плотным эмбеддингам.

Когда начал проектироваться внутренний поиск

Разработка Labrador началась не сегодня. В рамках антимонопольного судебного процесса над Google в 2024 году руководитель направления ChatGPT Ник Терли дал показания под присягой, раскрывающие историю проекта:

  1. OpenAI начала проектировать свой поисковый индекс еще в 2023 году.

  2. Первоначальный план был сверхагрессивным: компания рассчитывала закрывать силами собственного индекса 80% поисковых запросов пользователей уже к концу 2023 года.

  3. Разработка ускорилась из-за проблем с качеством данных от сторонних партнеров. OpenAI пыталась договориться о покупке данных у Google, но получила отказ.

  4. По оценке Терли, даже при идеальных условиях OpenAI потребуется не менее 5 лет совместной работы с крупным поисковиком, чтобы просто оценить, способна ли компания полностью отказаться от внешних источников данных.

Товарный поиск как полигон для A/B-тестов

Наиболее активно собственный индекс тестируется в товарной вертикали (Shopping). В середине августа 2026 года в коде ответов ChatGPT был зафиксирован масштабный A/B-тест под названием prefer-index-over-serp-v3 (предпочтение собственного индекса внешней выдаче). Этот эксперимент затронул 8% всех чатов пользователей.

Технологический стек товарного поиска ChatGPT устроен следующим образом:

  • BM25 (лексический поиск): Отбирает и фильтрует стартовые 10 источников.

  • rerank400 и prod400: Формируют пул из 400 товаров-кандидатов и проводят их глубокое повторное ранжирование.

  • ann4096 и ann12288: Модели векторного поиска (Approximate Nearest Neighbor), работающие на размерностях векторов 4 096 и 12 288.

На начало сентября 2026 года в ChatGPT параллельно работали минимум 5 экспериментов по товарному поиску (включая prefer-index-over-serp-v3, chatgpt-shopping-noamazon и shopping-index-q2qb), тестирующих различные конфигурации собственного индекса.

ChatGPT использует 8 внешних провайдеров

Несмотря на успехи Labrador, OpenAI пока не может полностью отказаться от внешней помощи. ChatGPT собирает поисковые ответы, комбинируя данные из 8 различных каналов:

  1. Собственный краулер OpenAI, сканирующий веб автономно.

  2. Bright Data (Bright): Используется для парсинга поисковой выдачи Google и сервиса Google Maps.

  3. Oxylabs: Отвечает за парсинг и доставку контента из новостной вертикали Google.

  4. Канал «serp»: Альтернативный поток для сбора новостей и локальных результатов.

  5. Yelp: Официальный лицензионный партнер для предоставления данных о локальном бизнесе.

  6. TripAdvisor: Лицензионный партнер для рекомендаций в сфере туризма и отдыха.

  7. Технические шлюзы b1 и b3: Внутренние каналы интеграции (b1 извлекает данные с бизнес-сайтов и страниц Facebook, b3 направляет запросы к картам Google Maps).

  8. Web IQ от Microsoft: Облачная платформа заземления (grounding), которая обеспечивает выдачу результатов с задержкой менее 165 миллисекунд и снабжает данными ChatGPT, Copilot и корпоративных клиентов вроде Nasdaq.

Что это значит для GEO специалистов

  • Bing больше не является главным ориентиром: Хорошие позиции вашего сайта в поисковой системе Bing не гарантируют автоматическое попадание в ответы ChatGPT. Алгоритмы отбора информации в ChatGPT строятся на базе собственной платформы Web IQ и индекса Labrador, чьи критерии ранжирования отличаются от стандартных поисковиков.

  • Приоритет на Yelp и TripAdvisor: Поскольку эти платформы являются официальными лицензионными донорами ChatGPT, локальному бизнесу критически важно иметь там максимально заполненные, актуальные и оптимизированные профили.

  • Контроль товарного присутствия: Владельцам интернет-магазинов необходимо регулярно проверять, как их товары отображаются в ChatGPT. Из-за постоянных A/B-тестов товарного индекса позиции продуктов могут часто меняться.

  • Проверка индексации через Lockdown: Используйте режим строгой изоляции в настройках ChatGPT, чтобы узнать, какие именно страницы вашего сайта уже сохранены во внутреннем кэше OpenAI и доступны пользователям даже без обращения к живому интернету.

Наличие внутреннего индекса сильно изменит ранжирование в ChatGPT, так что GEO специалистам придется менять стратегии. Еще недавно к примеру Reddit очень часто использовался для выдачи как источника ответа, но сейчас с каждый апдейтом его цитирование падает. Нечто подобное будет происходить и с другими источниками когда будет набрана критическая масса статей и фактов.

ссылка на оригинал статьи https://habr.com/ru/articles/1079850/