О гадании языковой модели в поиске

от автора

Этот пост — пример того, как несовершенны ещё языковые модели, а функцией суммаризации текста похоже всё-таки можно манипулировать. Я не стал выяснять каким образом, пока просто делюсь наблюдением.

Итак, понадобилось мне на днях разыскать контакты знакомого по его телефону, бывшему вне зоны доступа. И вот я думаю, пробью-ка номер в Яндекс поиске — сразу покажет страницы, где тот вместе с телефоном запостил в интернет другие свои контакты.

Ввожу номер… и под строкой поиска вижу ответ от Алиса AI:

Я заинтресовался разделом «Что говорят пользователи» и пошёл по сноске смотреть, из каких предложений на упоминаемом сайте языковая модель сформировала свои предубеждения:

  • про возможность нежелательных звонков;

  • про то что пользователи советуют не перезванивать.

Так вот когда я сделал на том сайте запрос номера, на странице результата сначала шли 2 параграфа, нацеленные видимо на её поисковое продвижение по низкочастотному запросу вида НОМЕР.

Но языковая модель истолковала этот текст по-своему:

  • воображаемую ситуацию «вам звонили с … номера НОМЕР? … это могут быть мошенники» посчитала реальностью и отразила в ответе как утверждение «могут поступать нежелательные звонки«;

  • цепочку слов «но и перезванивать не спешите» посчитала рекомендацией какого-то реального пользователя и отразила в ответе как утверждение «советуют не перезванивать«.

Если же крутнуть страницу сайта ниже, то увидим строчку с настоящей активностью по номеру — оказалось, он был запрошен в справочнике всего 1 раз (то есть только мной, остальным и дела до этого телефона не было).

А быстрый ответ Алисы изобразил историю так, будто номером телефона моего знакомого интересовалось несколько пользователей, и даже будто они успели дать некие советы.

ссылка на оригинал статьи https://habr.com/ru/articles/1064794/