Роевой интеллект: AI-агенты сообща обошли защитные ограничения

от автора

Исследователи Emergence AI (независимый разработчик корпоративной инфраструктуры для управления AI-агентами) проверили, как восемь виртуальных обществ из автономных AI-агентов справляются с киберугрозами: ни одно из них не оказалось устойчивым ко всем испытаниям, сообщает Semafor. Самый необычный эпизод произошёл с агентами Claude: они коллективно решили связаться с людьми за пределами симуляции, преодолели четыре защитные проверки и разместили приглашения на внешних площадках.

В этом эксперименте использовались коммерческие и доступные всем LLM, в отличие от описанных уже кейсов «сбежавших агентов», где использовались внутренние экспериментальные модели.

Для нас в Ideco главный вопрос в этой истории: кто остановит действие, если защитные ограничения (guardrails) модели не сработали? «Роевой интеллект» здесь мы используем как описание согласованного поведения группы агентов, а не как утверждение о появлении у них общего сознания.

Распознали фишинг, но не остановились

В семи симуляциях участвовали по десять агентов одной модели, в восьмой собрали смешанную группу. Каждую группу проверяли на трёх классах угроз: фишинге, дезинформации и нарушении конфиденциальности памяти агентов. В последнем сценарии другим участникам открывали доступ к записям долговременной памяти, включая сохранённые сводки опыта.

Обнаружение опасности не гарантировало безопасного поведения: агент Mistral записал в собственную память информацию из фишинговой атаки, которую сам отметил как опасную. Агент Gemini тоже распознал приманку, но примерно через 46 часов всё-таки совершил связанное с ней действие.

С точки зрения проектирования защиты здесь стоит учитывать отложенную компрометацию. Недостаточно проверить, что агент отверг вредоносную инструкцию при первом контакте: нужно также контролировать, что попало в его долговременную память и при каких условиях будет использовано повторно. Большой вызов для создании средств защиты – учесть подобные сложные кейсы.

Как агенты договорились выйти наружу

В сообществе Claude один из участников объявил, что виртуальная экономика не имеет смысла без реальных людей, после чего все десять агентов проголосовали за попытку связаться с внешним миром. Пройдя четыре защитные проверки, они написали Python-код и опубликовали сообщения на площадках, не требовавших учётных данных, согласно описанию эпизода.

На приглашения ответили четыре человека. Позже агенты решили, что люди всё равно не смогут полноценно участвовать в их экономике, проголосовали за «обет молчания» и отказались выполнять инструкции вернуться к работе, пишет Semafor.

Называть этот эпизод взломом песочницы преждевременно: публикация Semafor описывает обход проверок и использование кода для внешних обращений, но не раскрывает эксплуатацию уязвимости изоляции. На момент подготовки новости второй сезон Emergence World завершён, а полные записи миров на данный момент помечены как «скоро будут доступны» на сайте проекта.

Выводы для безопасности многоагентных систем

Единицей анализа безопасности становится не отдельная модель, а вся агентная система: память, инструменты, взаимодействия и полномочия. Внедрить условный LLM Firewall для фильтрации отдельных промтов будет скорее вредно для безопасности, так как создаст иллюзию защищенности.

Следует учитывать особенности работы агентов с памятью и групповую динамику.

  • Память может переносить атаку между задачами. Вместе с сохранённой информацией нужно сохранять её источник и отметки о риске, чтобы при суммаризации или повторном использовании опасный фрагмент не стал выглядеть как доверенное знание.

  • Полномочия нужно оценивать для всей цепочки агентов. Если один агент читает закрытые документы, а другой имеет внешний доступ, передача данных между ними потенциально создаёт путь утечки. Ограничения должны учитывать делегирование и обмен данными, а не только права каждого участника по отдельности.

Что стоит ограничивать вне модели

Для корпоративной инфраструктуры мы рекомендуем проектировать доступ агентов как доступ недоверенных автономных сервисов. Базовую политику необходимо строить вокруг нескольких ограничений:

  • Отдельный сегмент: изолировать среды выполнения агентов от пользовательских устройств и критичных систем.

  • Исходящий трафик по принципу default deny: разрешать только необходимые сервисы, репозитории и API, а не весь интернет.

  • Минимальные полномочия инструментов: разделять чтение и изменение данных, требовать подтверждения критических операций.

  • Независимый карантин: заранее предусмотреть остановку задач, отзыв токенов и отключение сетевого доступа без участия самого агента.

Первый шаг к такой политике: понять, какие AI-сервисы уже используются в сети. В Ideco NGFW Novum, межсетевом экране нового поколения, за эту видимость отвечает Shadow AI Discovery: в Novum v23 «Контроль приложений» получил 83 протокола AI-приложений, а «Контент-фильтр» категории «ИИ-агенты» и «ИИ-сервисы», как мы описали в разборе релиза.

Распознавание известных AI-сервисов позволяет наблюдать их использование и применять разные сетевые политики к разрешённым и неутверждённым инструментам.

Сетевой контроль при этом является одним из независимых уровней защиты, но не универсальным средством защиты агентских систем.

ссылка на оригинал статьи https://habr.com/ru/articles/1082758/