Открывая онлайн-кинотеатр, сервис для прослушивания аудиокниг или музыки, пользователи редко задумывается о том, почему перед ним оказались именно эти фильмы, книги или треки. Между тем рекомендательные системы в последнее время переживают крупную трансформацию. Если раньше задача сервисов сводилась к поиску похожих пользователей или товаров, то сегодня они уже умеют предугадывать намерения человека, и развитие LLM ускорило этот процесс.
Делюсь инсайтами с конференции «Урбан ML», которая прошла 2 августа в Loft Hall (ЗИЛ) в Москве. Эксперты по Data Science поделились, от чего отказываются современные рекомендательные системы, какие проблемы остаются нерешенными и куда движется отрасль.

Масштабная конференция «Урбан ML» от МТС True Tech и ВТБ объединила инженеров, исследователей и разработчиков, чтобы обсудить, как современные технологии машинного обучения работают в реальных сервисах.
Участники разбирали практические кейсы: применение LLM, разработку ML-платформ, инфраструктуру, генеративный ИИ и рекомендательные системы. Последней теме был посвящен отдельный блок выступлений экспертов MWS, которые рассказали, как меняются подходы к построению рекомендаций и какие вызовы стоят перед отраслью сегодня.
От поиска похожих пользователей к прогнозированию поведения
Долгое время рекомендательные системы строились вокруг достаточно понятной логики. Если пользователи с похожими интересами покупали определенные товары или смотрели одни и те же фильмы, то алгоритм предлагал аналогичный контент и другим людям со схожим поведением. Такой подход, основанный на коллаборативной фильтрации и анализе истории взаимодействий, стал фундаментом большинства цифровых сервисов.
Однако по мере роста объемов данных стало очевидно, что знаний о прошлых предпочтениях пользователя недостаточно, чтобы делать качественные рекомендации. Современные сервисы должны реагировать практически мгновенно: учитывать смену интересов, контекст, устройство, время суток и десятки других факторов, влияющих на принятие решения.
Как отмечает Данил Бугриенко, ведущий инженер по машинному обучению в MWS, сегодня разработчики все меньше пытаются определить, что именно нравится человеку, и все больше сосредотачиваются на вероятности конкретного действия.
На первый взгляд разница кажется незначительной, однако именно она определяет направление развития всей отрасли. Если раньше разработчики рекомендательных систем пытались понять, какой контент может заинтересовать пользователя, то сегодня они создают алгоритмы, способные прогнозировать его ближайшие действия — что он откроет, посмотрит, купит или пропустит.
Такой подход позволяет строить гораздо более гибкие модели поведения. Вместо жесткой привязки к интересам пользователя система оценивает множество небольших вероятностей — просмотр карточки товара, переход к описанию, запуск фильма, добавление товара в корзину или оформление заказа. Затем эти локальные прогнозы объединяются и помогают оптимизировать уже бизнес-показатели более высокого уровня — удержание аудитории, вовлеченность и удовлетворенность сервисом.
Почему проблема холодного старта до сих пор не решена
Несмотря на стремительное развитие искусственного интеллекта, некоторые задачи остаются актуальными уже больше двух десятилетий. Одна из них — проблема холодного старта.
Сложность заключается в том, что новый пользователь еще не успел оставить цифровой след: система практически ничего не знает о его интересах, поэтому ей сложно подобрать действительно релевантные рекомендации. Аналогичная ситуация возникает и при появлении нового товара или контента, у которого еще нет истории взаимодействий.
Данил Бугриенко, ведущий инженер по машинному обучению в MWS, отметил, что универсального решения этой проблемы до сих пор не существует: «Проблема холодного старта — глобальная, она существует очень давно, и вариантов решения много».
Одним из наиболее эффективных подходов сегодня становятся рекомендации, формируемые непосредственно во время работы пользователя с сервисом. Даже если человек только открыл приложение, система уже начинает анализировать первые действия: какие карточки он просмотрел, какие пропустил, на что обратил внимание, а что проигнорировал.
«Если сервис строит рекомендации в момент обращения, можно смотреть на последние действия пользователя. Он еще ничего не посмотрел, но уже начал взаимодействовать с приложением. Например, увидел какие-то объекты и не кликнул на них. Значит, подобных объектов стоит показывать меньше», — объяснил Данил.
Дополнительным источником информации становится поведение всей аудитории. Даже если о конкретном пользователе пока ничего неизвестно, система может использовать статистику миллионов других взаимодействий, чтобы сделать первые предположения о том, какие объекты окажутся наиболее интересными.
Именно поэтому современные рекомендательные платформы все чаще переходят от периодического пересчета моделей к обработке событий практически в режиме реального времени. Чем быстрее алгоритм адаптируется к действиям пользователя, тем меньше влияние холодного старта и тем быстрее рекомендации становятся действительно персонализированными.
Как генеративный искусственный интеллект меняет архитектуру рекомендаций
Появление больших языковых моделей стало одним из наиболее заметных событий для всей области машинного обучения, и рекомендательные системы не стали исключением. Однако, как подчеркивает Сергей Кузнецов, руководитель разработки платформы рекомендаций и поиска MWS, LLM — новый инструмент, который нужно использовать с умом, четко понимая его ограничения.
Главное ограничение, с которым сталкиваются все разработчики, — задержки. Рекомендательные системы привыкли отвечать за сотни миллисекунд (200–300 мс), тогда как LLM нужно несколько секунд на ответ. Сергей привел в пример исследование Amazon, согласно которому каждые лишние 100 мс отнимают 1% прибыли:«Мы глазами этого не замечаем, но каждая лишняя сотня миллисекунд — это прямо важно для рекомендаций».
Второе ограничение — стоимость. Использование LLM в продакшне требует дорогих GPU, и далеко не всегда экономика оказывается оправданной. Как отмечает Сергей, «посчитать экономику в этом деле — это зачастую больно. Часто бывает, что идея очень красивая и классная, а когда начинаем считать, то понимаем, что стандартные подходы тоже неплохие».
Третье ограничение — безопасность и надежность. Рекомендаторы не привыкли думать о том, что модель может сгенерировать нежелательный ответ. Эксперт вспоминает, что разработчики столкнулись с ситуацией, когда на абсурдный запрос модель сгенерировала неуместный ответ. Это стало важным напоминанием о необходимости продумывать защитные механизмы на ранних стадиях разработки.
Несмотря на это, LLM находят свое место в архитектуре. В своем докладе Сергей выделил три сценария, где их использование оправдано:
-
Обогащение признаков (оффлайн). Это самое простое и эффективное применение. LLM сжимает большие текстовые описания в компактные теги или эмбеддинги, с которыми стандартным моделям работать проще и быстрее. Поскольку все делается в оффлайне, проблемы с задержками и стоимостью практически снимаются.
-
Генерация кандидатов (оффлайн). Здесь LLM может совершить прорыв в решении проблемы холодного старта. Модель, обученная на текстовых описаниях, способна рекомендовать новый фильм или товар, о котором еще нет данных взаимодействия, просто понимая его описание и контекст запроса.
-
Конверсационные сценарии (онлайн). Это самый перспективный и сложный вариант. Вместо пассивного наблюдения система вступает в диалог с пользователем. LLM становится агентом, который может задать уточняющие вопросы, переформулировать запрос и значительно повысить релевантность выдачи.
В MWS для такого конверсационного сценария выбрали модель Gemma, которая, по словам Кузнецова, «немножко хуже по качеству, но настолько быстрее и настолько дешевле, что это позволило обработать больше запросов в секунду (RPS)». Это яркий пример осознанного компромисса между качеством, скоростью и стоимостью.
Какие метрики показывают, что система работает
Как отмечает Данил Бугриенко, каждый сервис считает успех по-своему. Однако есть несколько ключевых метрик, которые используют практически все:
-
Возвращаемость (Retention). Она показывает, насколько часто пользователи готовы возвращаться в сервис. Это одна из самых важных бизнес-метрик, но работать с ней напрямую сложно: непонятно, какие именно изменения в алгоритме на нее влияют.
-
Коэффициент ежедневной активности (Stickiness Factor). Он рассчитывается как отношение ежедневной аудитории к месячной: чем выше показатель, тем лучше сервис удерживает внимание пользователей.
-
Уменьшение обращений в техподдержку. Для некоторых продуктов уменьшение таких обращений становится главной целью, потому что качественные рекомендации помогают пользователю находить нужное без лишних вопросов.
Еще Сергей подчеркнул,что в конечном счете все упирается в одну универсальную метрику — деньги. Продукты заранее рассчитывают, сколько им приносит каждый привлеченный клиент, и оценивают окупаемость внедрения новых моделей. При этом эксперт отмечает, что для LLM экономика почти никогда не сходится сразу: «Это чаще всего некоторый прыжок веры в то, что мы верим, что будет становиться дешевле».
В сухом остатке
Главный вывод из выступлений спикеров: отрасль стоит на пороге серьезных изменений. Рекомендательные системы учатся вести диалог с пользователем, понимать его текущие намерения и помогать достигать цели здесь и сейчас.
Следующее поколение таких систем будут оценивать не по тому, как точно они предсказывают «похожие товары», а по тому, насколько хорошо они чувствуют пользователя и экономят его время. Российские компании, и MWS в их числе, находятся в центре этих изменений: они строят собственные платформы, экспериментируют с LLM и ищут разумные компромиссы между качеством моделей, скоростью ответа, стоимостью инфраструктуры и надежностью сервиса. И, судя по всему, это только начало.
ссылка на оригинал статьи https://habr.com/ru/articles/1066076/