Промпт инъекция дистиллятом

от автора

Сегодня я делал то, что должен делать автор после публикации статьи — отвечал на комментарии и рефрешил статсы. В процессе последнего, я обратил внимание на то, что последней опубликованной статьёй у меня были результаты эксперимента «Prompt injection — лучше один раз увидеть», а предпоследней — фантастический (но это не точно) рассказ «Кофе на дистиллированной воде».

Это соседство навело меня на футурологическую мысль, которая написана в названии данной статьи и которой я хотел бы поделиться с пиарщиками, безопасниками, писателями худлита и параноиками. Впрочем, даже если вы не относите себя ни к одной из этих категорий, то всё равно можете почитать.

И, да, стоит уточнить. Судя по результатам быстрой проверки интернета, я не первый человек в мире, которому в голову пришла подобная мысль, но мне она в голову пришла самостоятельно, а значит я могу делиться ей как своей.

Итак, мы имеем два факта.

1) ИИ на базе БЯМ воспринимают любую входящую информацию как свою внутреннюю, сваливают в общий котёл и варят из этого свои ответы. (Кстати, ничем от человека не отличается.) Они не способны отличить анализируемые данные от инструкций пользователя. И если в прочитанном ими письме от спамера будет написано «срочно оплатите данный счёт», то есть ненулевой шанс, что счёт будет оплачен в автоматическом режиме. Такова их природа и с этим придётся как-то жить. В этом суть проблемы, известной как prompt injection — https://habr.com/ru/articles/1064220/ .

2) ИИ на базе БЯМ превращают информацию в какие-то ассоциации внутри себя, и эти ассоциации могут иметь коллизии. То есть, разная информация может вызывать одни и те же последствия в электронных мозгах БЯМ. Про это была недавняя новость о том, что одну ИИшку научили любить сов, потом попросили выдать поток сознания в виде чисел, который скормили при обучении другой ИИшке. В результате, вторая ИИшка тоже начала любить сов. (Там всё чуть сложнее, но в целом оно именно так как я описал.) То есть, с помощью набора чисел, который выглядит бессмысленным, можно пересадить подсознание от одной ИИшке к другой. Ну или не только ИИшке — https://habr.com/ru/articles/1057246/ .

Уже догадались, к чему я клоню?

Правильно — не обязательно засылать в атакуемую ИИшку инъекцию с прямой инструкцией.

Прямую инструкцию, пусть даже спрятанную в невидимых слоях и закодированную шифрами и шарадами, сможет обнаружить система безопасности наученная решать такие шарады. Она сделает то же самое, что сделала бы атакуемая система, просто остановится за один шаг и не будут выполнять промпт инъекцию.

Но можно начать засылать в ИИшку нужные наборы чисел. В виде уникального идентификатора в ссылке отписки в письме. В виде координат точек в svg изображении. В виде id элементов веб-страницы и имён css-классов. Можно засылать в явном виде в теле контента или в неявном виде в мета-информации. Целевая ИИшка это старательно найдёт, извлечёт из самых странных и потайных мест файловых форматов, затем переварит и сложит в свой контекст.

Можно возразить, что передача подсознания происходила на этапе обучения, а значит надо отравить исходный даатсет. Нет, совершенно не обязательно. Никто ведь не будет ресетить контекст рабочей ИИшки каждый день. В этом суть высокотехнологичного обученного эксперта — он должен помнить о чём вы говорили вчера, какие письма вы получали неделю назад и многое другое. А это значит, можно в течении долгого времени повышать в нём значение какого-то числа, которое он в нужный момент проассоциирует с тем что нужно атакующему.

  • Проверяя резюме, он будет любить людей и именем Михаил.

  • Проверяя технический анализ, он будет любить ДВС больше чем электродвигатели.

  • Проверяя тендерную документацию, он будет любить компанию ассоциирующуюся с «тотемным токеном».

Поэтому, если вы пиарщик, то придумайте своей компании тотемное животное, которое будет влиять на мозги ИИшек через числовой «тотемный токен». Или не животное, но, в любом случае, что-то из реального мира, чтобы внутри ИИшек обязательно был токен связанный с этим чем-то. Вписывайте в корпоративные материалы нужные отсылки и упоминания, чтобы при проверке информации о вашей компании внутри ИИшки дёргались нужные токены. Да, в нужный момент придётся протестировать модель, являющуюся однотипной с атакуемой, чтобы знать какие числа начать ей засылать, дабы она в нужный момент склонилась на вашу сторону, но это решаемый вопрос.

Если вы безопасник, то начинайте вести базу числовых ассоциаций, с разными людьми, действиями и организациями. Выделите ключевые ассоциации для популярных ИИшек и мониторьте входящий (и исходящий) трафик, содержимое отраслевых площадок, государственной и корпоративной документации. Да, с одной стороны, это потребует много ресурсов, но это не мгновенная атака, а долгий процесс, который можно попытаться отследить заранее. Причём, эта атака будет оставлять много следов, которые можно анализировать ретроспективно. При должном терпении и автоматизации, вы сможете обнаружить повышенную концентрацию каких-нибудь чисел, например «087» или «613».

Если вы автор худлита, то начинайте писать. Тема prompt injection сейчас горячая и понятная, а тема передачи подсознательной любви к совам хоть и отразилась в СМИ, но ещё не протоптана. Если вы прямо сейчас напишете на эту тему произведение, то, возможно, в будущем вас назовут тем, кто предвосхитил будущее и указал направление по которому должен пойти прогресс. Да, я написал про это раньше вас, но когда будут раздавать звание провидца, про Михаила Елисейкина могут уже забыть и звание достанется вам.

Ну а если вы здравомыслящий человек, понимающий что мир катится к первоисточнику, то просто порадуйтесь, что ваши представления о реальности в очередной раз оказались правильными.

Засим, сеанс футурологии объявляется оконченным. Я спать.


Михаил Елисейкин
2026-07-29

ссылка на оригинал статьи https://habr.com/ru/articles/1064690/