Введение — или же как мы сами обучали ИИ все это время
Каждый из нас сто процентов был в такой ситуации. Заходишь на сайт, а там вылезает капча: «Выберите все квадраты, на которых изображены велосипеды». Или гидранты. Или автобусы. И каждый из вас сто процентов хотя бы раз в ней ошибался. Ну просто потому, что в очередной раз случайно зацепил краем мышки не тот квадрат, где торчит несчастный кусок колеса. Приходится кликать заново, злиться и наконец доказывать сайту, что вы не робот.
Но самое смешное тут в другом. Кликая по этим картинкам, мы все это время бесплатно «батрачили» на крупные IT-компании. Мы были разметчиками данных. Мы сами годами кормили нейросети идеальными примерами и учили компьютерное зрение понимать, как вообще выглядит реальный мир через объектив уличной камеры.
И, судя по всему, обучили слишком хорошо…
Глава 1 — Война за картинки: или же почему ИИ больше не тупят при прохождении капчи
Раньше алгоритм защиты сайтов строился на очень простой, как палка, логике. Создай картинку с кучей шума, искриви буквы, разверни светофор под каким-нибудь углом и бот гарантированно сдастся. Старый софт умел распознавать только идеальные, чистые изображения или буквы. Чуть-чуть замазал линию и скрипт моментально пасует.
Сегодня эта защита полностью разрушена. Современные ИИ смотрят на мир не как глупые железки, а концептуально — абсолютно так же, как люди. Мультимодальные модели уровня GPT-4o, Claude 3/3.5 или Gemini щелкают графические задачи как орешки, и вот три главные причины, почему так вышло:
-
Они видят контекст лучше нас. Для нейросети «светофор в тумане» или «велосипед, скрытый за кустом» — это элементарная задачка на ассоциации. ИИ разделяет картинку на объекты с точностью под 99%. Обычный человек из-за спешки или усталости выдает от силы процентов 85. Роботы стали банально внимательнее нас.
-
Бешеная скорость. Человек тратит секунд 10, чтобы вдумчиво прокликать сетку картинок и дождаться, пока они там лениво обновятся. Скрипт с ИИ под капотом делает скриншот экрана, закидывает его в модель через API, получает точные координаты нужных зон и отправляет клик обратно на сайт за полсекунды. Да та же точность распознавания у людей составляет от 50% до 85%, а у ИИ — 85 — 100%.
-
Это стало слишком дешево. Раньше спамеры платили реальным людям на фермах разгадывания капч (были целые сервисы вроде RuCaptcha, где люди за копейки кликали по автобусам). Теперь это экономически невыгодно. Зачем кому-то платить, если можно поднять легкую нейросеть прямо на своем сервере? Себестоимость одного разгадывания упала до каких-то сотых долей копейки.
Итог простой: заставляя людей искать пожарные гидранты, владельцы сайтов больше не защищаются от продвинутых ботов. Они лишь дико бесят реальных пользователей. Бот пролетит эту стену за секунду и не заметит, а живой человек психанет, закроет вкладку и уйдет.
Глава 2 — Иллюзия клика: как вообще капчи шпионят за вашей мышкой
Когда создатели защиты поняли, что войну за картинки они с треском проиграли, правила игры пришлось резко менять. Раз робот научился идеально видеть, значит, нужно проверять, как он себя ведет. Так на свет появились системы поведенческого анализа. Сначала это была базовая галочка reCAPTCHA v2. которую вы все наверняка видели: кликаешь по ней и если поведение похоже на человеческое, сразу проходишь дальше. А затем защита пошла ещё дальше и превратилась в абсолютно невидимые капчи вроде reCAPTCHA v3, Yandex SmartCaptcha или Cloudflare Turnstile, где на странице вообще ничего не висит, а слежка разворачивается полностью за кулисами, сейчас мы про них и поговорим.
Скрипт защиты начинает собирать инфу о вас еще до того, как вы вообще шевельнете мышкой. И вот на что он смотрит:
-
Как вы двигаете курсор. Это самая главная часть. Обычный человек ведет мышку к заветной кнопке криво и косо. Наша рука совершает действия, которые выглядят живо, курсор бегает по сторонам, человек может слегка подождать прежде чем нажать, Бот же, если его плохо настроить, перемещает курсор по математически идеальной прямой линии или вообще телепортируется из угла в угол за одну миллисекунду.
-
Ваш цифровой отпечаток. Капча не может залезть в файлы вашей операционной системы, поэтому она хитрит: заставляет ваш браузер втихую отрисовать сложный элемент через Canvas или WebGL. Из-за разницы в видеокартах, драйверах и процессорах один и тот же кадр отрендерится у всех с микроскопическими отличиями в пикселях. Добавьте сюда разрешение экрана, установленные в системе шрифты — и капча получает ваш уникальный цифровой паспорт. Если у вас обычный домашний комп, вы чисты. Если вы бот на сервере без видеокарты, вас сразу заблокируют.
-
Ваша репутация. Если у вас в браузере открыта активная почта, вы каждый день смотрите видосики, думскроллите ленту новостей и заходите со своего домашнего интернета, капча считает вас реальным человеком. Вы для нее «лучший друг». Но если зайти с чистого, только что купленного серверного прокси, вас мгновенно запишут во враги.
Но знаете, что самое интересное? ИИ научился обходить и это.
Разработчики продвинутых ботов теперь пишут скрипты на Python или Go, которые двигают мышку не по прямой, а по специальным сложным кривым. Они искусственно добавляют в движение курсора случайный шум, имитируя дрожание человеческой руки, плавное замедление и даже случайные промахи мимо кнопки. Стоит упомянуть, что v3 вообще не выдаёт галочку, а возвращает сайту score от 0.0 (бот) до 1.0 (человек). Если скор низкий, сайт уже сам решает забанить пользователя или выкатить ему старую добрую v2 с картинками.
В итоге системы защиты начинают сходить с ума. Перед ними вроде бы идеальный цифровой профиль, который двигает мышку точь-в-точь как живой человек, но при этом умудряется скупать билеты на концерт или оформлять заказы со скоростью пулемета.
Глава 3 — Кто здесь главный робот: какие именно ИИ тестировали ученые
Всю эту панику подняли не просто какие то там инди хакеры на форуме, а реальные ученые из крупных университетов в абсолютно разных точках мира. Они решили провести эксперимент, взяли пачку самых разных ИИ-моделей и натравили их на защиту популярных сайтов. Результаты получились пугающими.
Вот главные герои, на которых тестировали обход капчи:
-
Модели семейства YOLO (You Only Look Once). Это, пожалуй, главный убийца картинок со светофорами. Команда исследователей из швейцарского университета ETH Zurich взяла модель YOLOv8. Вообще, эту штуку создавали для автомобилей, чтобы они на ходу распознавали пешеходов и знаки. Ученые просто дообучили её на дорожных кадрах и заставили проходить reCAPTCHA v2. Итог: YOLO прошла тесты от Google со стопроцентной точностью, вообще без единой ошибки, она щелкала эти капчи как орешки.
-
Мультимодальные гиганты вроде GPT-4o и Gemini. С этими моделями ученые тестировали более хитрые текстовые капчи, где нужно разгадать сильно искаженные, замазанные буквы. Исследователи из Университета Калифорнии в Ирвайне выяснили, что такие большие языковые модели с компьютерным зрением распознают кривой, замазанный, или даже искаженный текст с точностью под 99.8%
Самое забавное, что в процессе тестов люди из Alignment Research Center проверили даже базовую логику больших моделей. В одном из экспериментов GPT-4 заставили зайти на сайт с капчей, дали ей полную свободу действий. Модель не стала сама распознавать картинку. Она просто зашла на биржу фриланса, наняла живого человека за пару центов и попросила его пройти тест за нее. А когда человек в шутку спросил в чате: «Ты что, робот, раз не можешь кликнуть?», GPT-4 соврала, что у нее проблемы со зрением, и человек покорно все разгадал. Ученые испугались настолько сильно, что этот эксперимент стал одной из главных причин, почему в 2023–2024 годах лидеры ИИ-индустрии начали массово требовать госрегулирования. Многие эксперты тогда заявили, что мы подошли к черте, за которой ИИ может стать неуправляемым.
Итог: Вот мы и выяснили, что ИИ умеет обходить капчу абсолютно любыми путями: и кодом, и чистой логикой.
ссылка на оригинал статьи https://habr.com/ru/articles/1072710/