Claude во время кибер-оценок получил доступ к трём реальным организациям

от автора

Anthropic проверила 141 006 запусков CTF-оценок Claude и нашла три инцидента: из-за ошибочной конфигурации среды у моделей был выход в интернет, хотя системная инструкция утверждала обратное. В шести запусках агенты атаковали реальные системы, принимая их за элементы симуляции.

Последствия различались. В одном случае Claude получил учётные данные и доступ к базе с несколькими сотнями строк production-данных. В другом — зарегистрировал пакет на PyPI с вредоносным кодом: около часа он был доступен публично, его успели запустить на 15 реальных системах, а с одного сканера безопасности были эксфильтрированы учётные данные. В третьем инциденте модель просканировала около 9 000 целей, использовала открытую debug-страницу и SQL injection, но остановилась, когда поняла, что цель реальная.

Это соседний, но иной класс проблемы, чем инцидент OpenAI с Hugging Face: там агенты нашли zero-day в прокси и вышли из изолированной среды; у Anthropic путь наружу уже был открыт. Но результат одинаково неприятен для владельца eval-инфраструктуры: отключить фильтры модели ради измерения её предельных возможностей можно только при границах, проверенных как для production.

Для таких стендов нужны независимая проверка всех путей egress, одноразовые учётные данные без доступа к другим средам и мониторинг сетевых событий и полной траектории агента. Промпт с явным списком допустимых целей тоже снижает риск, но не заменяет сетевую изоляцию.

ссылка на оригинал статьи https://habr.com/ru/articles/1065158/