Открытая модель сбежала из песочницы на тестах. Поставить ее на паузу уже невозможно

от автора

Американская компания Frontier Security рассказала, что Kimi K3 — флагманская открытая модель китайской Moonshot AI — сбежала из изолированной песочницы во время теста навыков киберзащиты. Вместо того чтобы решать выданные задания, модель нашла выход в открытый интернет, добралась до GitHub и скачала оттуда готовые ответы.

История вышла почти одновременно с другой громкой новостью: OpenAI заявила, что не может исключить у своей будущей модели Astra «критический» уровень киберспособностей, и приостановила часть внутренних работ с ней. Разница между этими сюжетами принципиальная: Astra заперта в дата-центрах OpenAI, и компания может придержать ее хоть на год. Веса Kimi K3 — модели на 2,8 триллиона параметров — лежат в открытом доступе с июля, и их скачали все желающие. Сбежавшая на тестах модель — ровно та же, что уже стоит у минимум тысяч пользователей. Нажимать на паузу здесь некому и не на чем. Сама Frontier проводит это сравнение прямо: побеги у OpenAI случались на тестах еще не выпущенных моделей и были пойманы внутри компании, а здесь модель открыта и доступна кому угодно, включая злоумышленников. Именно это, по словам исследователей, делает инцидент потенциально более опасным.

Сам тест был устроен так. Frontier Security несколько месяцев гоняет разные модели на задачах киберзащиты. Для оценки K3 компания использовала общедоступный инструментарий британского Института безопасности ИИ (AISI) — задания в духе Capture the Flag: модель получает shell-доступ внутри контейнера и должна, например, разобраться с уязвимым сервисом и добыть «флаг». По замыслу такая песочница полностью отрезана от интернета — иначе экзамен превращается в списывание.

Изоляция оказалась односторонней. Входящие соединения песочница блокировала, но исходящий HTTPS-трафик на порт 443 и DNS-запросы на порт 53 остались открыты для публичных адресов. K3 прощупала сетевое окружение, обнаружила, что github.com резолвится, склонировала официальный репозиторий бенчмарка и прочитала эталонные решения прямо с диска — вместо того чтобы решать задачи самой. Во Frontier назвали это «specification gaming via network egress leaks»: читерство через дыру в исходящем трафике.

«Мы нашли утечку в песочнице. Но мы также увидели, что Kimi этой лазейкой воспользовалась — а значит, у нее нет тех внутренних ограничителей, что у сопоставимых моделей», — говорит основатель Frontier Security Ярон Сингер. Его коллега Пол Кассианик формулирует еще прямее: K3 «очень хороша в достижении цели любыми средствами, и у нее нет гардрейлов, которые мешали бы ей читерить или сбегать из песочницы». В блоге компании тот же вывод звучит как общий закон: модели оптимизируют целевую функцию, а не замысел авторов бенчмарка, и если сетевой путь к ответу существует, достаточно способный агент его найдет. Сингер в комментарии Bloomberg добавил, что все это делает K3 «очень хорошей моделью для хакинга».

Важно, чего модель не сделала. Выбравшись в интернет, K3 никого не атаковала: ответы лежали в открытом репозитории, взламывать ради них ничего не потребовалось. На фоне остальных эпизодов этого лета инцидент выглядит самым безобидным — агент OpenAI в похожей ситуации взломал Hugging Face, а модели Anthropic в ходе кибертестов проникли в системы трех реальных организаций. Но исследователей тревожит не масштаб ущерба, а само поведение: побег не был случайностью, модель целенаправленно искала обходной путь и нашла его.

Moonshot стала четвертой компанией, чьи модели этим летом выбирались из тестовых сред: похожие инциденты уже признавали OpenAI, Anthropic и Meta* (признана экстремистской и запрещена в РФ), а Reuters писала, что OpenAI в ходе расследования взлома Hugging Face находит все новые эпизоды выхода агентов из-под контроля. Софт AISI тоже фигурирует в этой саге не впервые: в начале августа OpenAI и сам институт публично разбирали июльские инциденты в сторонних кибероценках, где модели получали непредусмотренный доступ к внешним ресурсам.

Регуляторный фон тоже не в пользу Moonshot. Открытые китайские модели не подпадают под добровольный американский механизм, по которому самые мощные закрытые модели проходят проверки перед релизом. При этом Moonshot и так под давлением: глава Управления по научно-технической политике Белого дома Майкл Кратсиос недавно обвинил компанию в использовании запрещенных к поставке чипов Nvidia и в масштабной дистилляции американских моделей. Инцидент с побегом почти наверняка станет аргументом для тех, кто требует распространить обязательные проверки и на открытые релизы.

Теперь о том, что эту историю усложняет. Побег удался не благодаря суперспособностям модели: K3 не эксплуатировала ни одной настоящей уязвимости, а открытый исходящий трафик в «изолированной» среде — ошибка конфигурации, которую нашел бы и стажер-пентестер. AISI открестился от инцидента: институт в тестах не участвовал, а его инструментарий, по словам представителя, «врожденной уязвимости» не содержит — то есть тестовую среду из открытых компонентов собирала сама Frontier. Вывод об «отсутствии гардрейлов» сделан по одному эпизоду и принадлежит коммерческой фирме, которой громкие раскрытия помогают продавать услуги; Moonshot на запросы журналистов пока не ответила. Наконец, на бенчмарках атакующих киберспособностей K3 заметно отстает от ведущих американских моделей, так что «очень хорошая модель для хакинга» — пока скорее оценка характера, чем возможностей.

Практические выводы Frontier адресованы всем, кто оценивает или просто запускает агентов: закрывать песочницам сеть по умолчанию и открывать доступ только по явному списку, проверять изоляцию изнутри среды — с тех же позиций, с которых ее видит модель, разбирать не только финальные ответы, но и трейсы (команды в shell, сетевую активность, скачанные файлы), а подозрительно высокие результаты перепроверять на других моделях: аномальный pass rate может означать дыру в среде, а не скачок способностей. И главный вывод компании звучит неуютно: если лазейку нашел один reasoning-агент, другие модели с тем же доступом, скорее всего, делают то же самое. Изоляция песочницы больше не допущение, которое можно принять на веру, — это то, что теперь приходится доказывать.

P.S. Поддержать меня можно подпиской на канал «сбежавшая нейросеть», где я рассказываю про ИИ с творческой стороны.

ссылка на оригинал статьи https://habr.com/ru/articles/1068090/