О нейросетях, детекторах генерации и правовых аспектах использования ИИ

от автора

Написать эту статью меня сподвиг странный случай. Я опубликовал на Хабре свою статью «Асимптотика на практике: Сравнение алгоритма сортировки вставками и выбором» и через некоторое время обнаружил ее в черновиках с пометкой «Сгенерировано». Это меня, конечно, сильно удивило, я написал в поддержку, сообщив о ложном срабатывании. Там мне ответили, что им в принципе неизвестны случаи ложного срабатывания.

Вот их позиция по поводу ложных срабатываний детектора (цитата из переписки):

«Попробуйте посмотреть на ситуацию с нашей стороны. Есть неизвестное нам заинтересованное лицо, утверждающее, что контент написан человеком, и есть проверенный временем и практикой бездушный инструмент, который утверждает, что текст содержит паттерны, характерные для применения нейросетевых моделей.

С ситуациями, когда нас пытаются ввести в заблуждение люди, мы сталкиваемся по нескольку раз в день, а случаи ложноположительного срабатывания инструмента нам пока не известны, хотя мы неоднократно проверяли им и свои тексты и тексты других людей в естественной природе которых (текстов) мы уверены. Проверяли даже учебник по математике 1976 года на 300+ страниц. Как люди, изучавшие теорвер в университетах, мы допускаем, что вероятность ложноположительного срабатывания теоретически существует. Но, когда речь идет не об одном, а об обилии нейросетевых паттернов, такое совпадение представляется нам маловероятным.

Если текст будет написан человеком, то наш детектор не выявит в нем обилия паттернов. Т. о. вы можете быть уверены в том, что если вы напишете текст самостоятельно, то санкции за нарушение п.4. применяться не будут.

Мы можем пойти вам навстречу еще раз и снова открыть материал для редактирования. Но если вы вновь воспользуетесь этим, чтобы опубликовать сгенерированный текст, то навсегда лишитесь возможности публиковать материалы на нашем ресурсе».

Получается интересная такая ситуация. Некий черный ящик говорит, что мой текст сгенерирован. Я не знаю как работает этот черный ящик, но если он еще раз скажет, что мой текст сгенерирован, меня забанят. Ситуация на первый взгляд, безвыходная. К счастью, существуют в открытом доступе другие черные ящики, типа «яндекс.нейро», которые тоже могут проверить мои тексты. Я уточнил у службы поддержки, могу ли я использовать в качестве доказательства, что мой текст не сгенерирован, показания этого детектора. Получив утвердительный ответ, я проверил свой текст на «яндекс.нейро», он показал что текст сгенерирован. При помощи манипуляций с текстом я добивался, что «красные полоски» были заменены на «синие».

И тут меня ждало любопытное открытие: оказывается, всего из-за пары слов детектор может изменить свое «мнение» о тексте. Смотрите сами, детектор ругается на генерацию:

Я удаляю заголовок «теоретическая часть». И вуаля, теперь текст пропущен:

То есть словосочетание «теоретическая часть» – это паттерн, характерный для нейросетевой генерации, о как!

Вот вам и «проверенный временем» детектор.

Таким образом, можно сделать вывод, что ложные срабатывания хоть и маловероятны, но возможны.  Позиция Хабр понятна, но есть и другое мнение.

Так в 2025 году студентка Московского международного университета была отчислена якобы за то, что ее диплом был сгенерирован нейросетью [1,2]. Она подала на университет в суд, суд встал на ее сторону и обязала университет восстановить студентку и выплатить компенсацию за моральный ущерб. Почему суд принял такое решение:

1.     Оценка системы носит вероятностный характер.

2.     Одни и те же фрагменты система определяла то как авторские, то как сгенерированные.

3.     Администрация не смогла объяснить, как работает детектор.

4.     Университет не смог предоставить сертификат, что его система правильная.

5.     Были процессуальные нарушения со стороны университета: студентку не пригласили на заседание кафедры, лишив возможность дать пояснения, кроме того, последний день сдачи выпадал на воскресенье, а значит, согласно ст. 193 ГК РФ, срок должен быть сдвинут на ближайший рабочий день.

Заключение

 Что касается моего мнения, то я полностью согласен с решением суда, и вот почему:

1.     Алгоритмы машинного обучения ищут статистические паттерны либо конкретные словосочетания. В моем случае паттерны «теоретическая часть» – это признак академического стиля, а не генерации нейронкой. Наглядный пример ложного срабатывания.

2.     В нашей правовой системе четко закреплена презумпция невиновности. Но случай с хабром и с университетом переворачивают этот принцип с ног на голову, вводя презумпцию виновности: детектор сказал, что это генерация, и попробуй докажи, что «ты не верблюд».

3.     Переписывание текста, чтобы «угодить» системе проверки – ну такое себе занятие: портить стиль, чтобы красные полоски стали синие – это абсурд!

4.     Ну, и конечно же, в правовой системе должен быть закреплен принцип открытой информации об алгоритмах работы систем детекции: никакой коммерческой тайны, никаких закрытых систем. Только вот примут ли наши депутаты такой закон – большой вопрос.

Источники

1.     Почему суд встал на сторону студентки, уличенной в использовании ИИ при написании диплома — Российская газета

2.     Студентка из Москвы доказала в суде авторство своего диплома — Новости на Вести.ru

ссылка на оригинал статьи https://habr.com/ru/articles/1063340/