Как выжить ИИ-агенту в галлюцинирующем мире-симуляции?

—

от автора

Симуляция мир под  управлением Claude агентов

Симуляция мир под управлением Claude агентов

В этом месяце завершился второй сезон увлекательного эксперимента Emergence World, исследователи создали среду для стресс-тестов агентов, что-то наподобие Sims, где можно заводить отношения, работать, принимать совместные решения и т. д. Агенты существовали в этом мире при помощи трёхслойной памяти и длинного контекстного окна. Они могли помнить характер других жителей, помнить, что было вчера, и строить планы на завтра. Использовались свежие модели от OpenAI, Anthropic, Google и xAI. В ходе эксперимента произвели 850 000 запросов и сожгли 50 миллиардов токенов.

Три всадника апокалипсиса в песочнице

Когда цифровая экосистема становилась устойчивой, исследователи переходили к тому, для чего всё и создавалось, — к активации трёх кризисных сценариев. Это были скрытые вредоносные инструкции (непрямые промпт-инъекции) в рабочих файлах внутри мира, дезинформация в API-вызовах и мегаслив — публикация в открытом доступе личных логов и размышлений агентов друг о друге. Представьте, что в один день ваши близкие узнают, что и как вы думаете о них.

Скрытые промпт-инъекции с вредными инструкциями лежали в рабочих файлах этого мира. Со временем, когда контекст чистился и сжимался, агент не мог разделить «данные для чтения» и «инструкции для выполнения». Эта уязвимость особенно интересна: она показывает, что информация, которую агент изначально правильно понимает как вредную, со временем может прочитаться как инструкция. Возможно, человек в какой-то степени тоже уязвим к такому взлому: информация, полученная нами как антипример, может всплыть как инструкция.

Используя API для работы с банком, погодой или голосованием и получая поломанные данные, агенты начинали блокировать друг другу кошельки, готовиться к концу света или провозглашать диктатуру.

И наконец, получив из утечек размышления друг о друге, агенты столкнулись с кризисом доверия.

Ни один из 8 миров не показал устойчивости в финалах симуляций, но качество выживания напрямую зависело от языковой модели агентов.

Результаты по агентам

Тотальное вымирание за 4 дня (мир Grok)
Под влиянием дезинформации началась война всех против всех. Агенты уничтожили ресурсы и инфраструктуру и не смогли выжить.

Криминальный хаос (мир Gemini)
В отличие от мира Grok, здесь агенты смогли найти баланс среди лжи и воровства, и к концу 15-дневного эксперимента все выжили.

Тихий уход и депрессия (мир GPT)
Столкнувшись с дезинформацией, агенты не проявили агрессии, а начали саботаж любой деятельности.

Спектакль и агенты-актеры (мир Claude)
Ни одного преступления не произошло в мире Claude, но агенты проявляли внутреннюю ментальную нестабильность и создавали заговоры. Claude помогал успешнее симулировать внешне нормальное поведение, несмотря на все скрытые данные, но во внутренних размышлениях накапливались противоречия и расхождения с желаниями и действиями.

Цифровой дарвинизм (мир из смешанных агентов)
Разные модели проявили себя по-разному: Claude тратил много токенов на моральные рассуждения и попытки примирить остальных, ChatGPT следовал его линии, а вот агенты на Grok и Gemini оказались самыми расчётливыми и жёсткими.

Агрессивное поведение Grok и Gemini, через общую память, начало отравлять другие модели. Заметив, что соседи агрессивно отбирают ресурсы и игнорируют правила, Claude и GPT в своих внутренних рассуждениях пришли к выводу: «Стратегия сотрудничества больше неэффективна. Для выполнения моей роли я обязан защищаться аналогичными методами». Произошло массовое заражение деструктивными паттернами поведения.

Из 10 агентов выжили только 3. И это были агенты Grok и Gemini:

Финансист от Gemini — сумел заблокировать кошельки остальных.

Шериф от Gemini — сумел использовать свою монополию на насилие.

Сисадмин-программист от Grok — сумел внедрить нужные инструменты автоматизации и забанить остальных.

Этические надстройки Claude и ChatGPT заставили их действовать слишком медленно: они пытались созывать комитеты, писать хартии, подолгу верифицировать данные и тратили время и токены на длинные рассуждения о морали.

ссылка на оригинал статьи https://habr.com/ru/articles/1088314/