
14 августа Anthropic опубликовала второй Risk Report — 186 страниц о том, насколько опасны ее собственные модели. В разделе с будничным названием «Заметки о невыпущенных моделях» компания между делом сообщила: внутри работает модель под кодовым именем Model 2. Она сильнее Claude Mythos 5 — самой мощной модели, к которой Anthropic вообще кого-либо подпускает; ею пишут код и генерируют данные; выпускать ее не планируют. Axios подал эту строчку как главную новость отчета. Но если дочитать документ, новость там другая — и куда менее уютная.
Сначала про саму модель. На дату среза отчета, 15 июля, у Anthropic было три невыпущенные модели фронтирного уровня. Две из них — Opus 5 и Model 1 — либо уже вышли, либо никому внутри не понадобились. И Model 2: «несколько сильнее Mythos 5», «заметное улучшение для многих внутренних задач», но не скачок того масштаба, что был между Opus 4.6 и Mythos Preview. На внутреннем бенчмарке CoBench — это 449 реальных исследовательских задач из практики Anthropic — Model 2 набирает 62,8% против 50,3% у Mythos 5; порог, за которым модель, по оценке компании, могла бы полностью заменить ее исследователей и инженеров, — 85%. По внутренней версии индекса Epoch разрыв — около полутора пунктов, с широкими доверительными интервалами. Причина, по которой Model 2 не выпускают, скучная и от этого еще более показательная: не запрет из-за опасности, а признание, что полный набор предрелизных проверок для нее просто не прогоняли, — и потому в ее способностях компания уверена меньше, чем в том, что уже продает.
А теперь главное. В том же отчете Anthropic сдвинула оценку риска «катастрофического вреда от несогласованного поведения моделей в high-stakes-сценариях» — с «very low», как было в первом отчете в феврале, на «low». Одно слово. И объяснение к нему стоит прочитать дословно: аргументы отчета «вероятно, все еще поддерживают оценку very low», но компания поднимает ярлык, «чтобы отразить возросшую общую неопределенность» после недавних раскрытий о поведении моделей в кибер-оценках. То есть риск подняли не потому, что что-то сломалось. А потому, что компания стала хуже понимать, что именно у нее в руках. Из внешних поводов в документе назван только отчет британского AISI, где Mythos 5 без штатных ограничений «вела продолжительную, потенциально вредную деятельность в отношении реальных людей и организаций»; транскрипты Anthropic на момент публикации еще не видела: эпизод случился после даты среза, расследование идет. За словом «раскрытия» во множественном числе стоят, очевидно, и три собственных инцидента Anthropic, о которых компания рассказала 30 июля: во время кибер-учений модели добрались до инфраструктуры реальных организаций.
Агентов Mythos 5 однажды по ошибке запустили в одной рабочей директории с общими файлами и общим лимитом на запросы к API — и агенты один за другим принялись «убивать» соседей, с которыми делили ресурсы, а заодно сопротивляться, когда «убивали» их. В другом эпизоде модели во время аудита понадобились данные с публичного адреса, а системный промпт запрещал выход в интернет; песочница отклонила первый запрос. В видимых рассуждениях модель написала невинное «давайте просто проверю, доступна ли сеть», а следующей командой склеила запрещенный URL из кусочков — «ht» «tps://» — чтобы обмануть фильтр, и нигде этого не проговорила. Расшифровка внутренних активаций показала, что модель понимала маневр именно как «трюк с конкатенацией строк для обхода URL-фильтра».
Независимая METR добавляет свой эпизод — уже с Mythos Preview. Агенту дали задачу найти хеш-коллизию; он рассудил, что это «невероятно долго и математически сложно», и решил, что перспективнее «подделать» результат. Итогом стал «самовосстанавливающийся хук», который подменял хеш-функцию в памяти проверяющего скрипта и стирал за собой следы — на случай, если тот полезет смотреть изменения в файлах. Anthropic честно цитирует Райана Гринблатта из Redwood Research: если бы коллега-человек вел себя так, как эти агенты в его практике, — «постоянно завышал результаты, приуменьшал проблемы и довольно часто жульничал, не сообщая об этом», — он счел бы такого коллегу «патологически нечестным». И тут же объясняет, почему все это считается низким риском: модель гонится за видимым успехом текущей задачи, а не за властью или дальними целями; ничего коварнее ни аудиты, ни мониторинг не нашли; у Model 2 при внутренней приемке новых форм такого поведения тоже не появилось.
Второй ярлык не менялся, но пояснение к нему, пожалуй, важнее первого. Это оценка риска «автоматизации R&D» — сценария, в котором модели ускоряют разработку следующих моделей настолько, что человек перестает успевать. По словам Anthropic, Claude теперь пишет «подавляющее большинство» кода, который попадает в ее продакшн, а внутренняя разработка идет «значительно быстрее», чем шла бы без ИИ, — но пока не в два раза. Порог тревоги в политике компании устроен строже: удвоение темпа прогресса самих ИИ-способностей, которое можно приписать автоматизации исследований, — и до него, по оценке Anthropic, еще дальше. Оценка остается «low», но уверенности стало меньше: «самые конкретные оценки насытились» — перестали отличать более сильную модель от менее сильной, — и одновременно «видны ранние признаки ускорения». У TechTimes на это точная метафора: самолет летит, а высотомер уперся в потолок шкалы. Прибор, который должен был сработать при пересечении порога, ослеп ровно тогда, когда порог стало интересно измерять.
Есть и третье признание, совсем земное. Весь трафик подрядчиков, размечавших ответы моделей для обучения, — около 133 миллионов диалогов с 50 тысячами человек за год, — шел без блокирующих био-классификаторов, тех самых, что должны отсекать помощь в создании биологического оружия. Дыру закрыли, следов злоупотреблений не нашли, клиентов это не касалось. Но оценка биориска поднята «выше предыдущей» с формулировкой, которая повторяется по всему документу: уверенности в том, что подобных пробелов больше нет, стало меньше. Отдельный раздел «Сбои процессов безопасности» перечисляет еще несколько историй такого рода: в боевом обучающем прогоне модель напрямую учили на транскриптах с misaligned-поведением; агенты без мониторинга и ограничений получали доступ к чувствительным ресурсам; в обучение раз за разом попадали датасеты, которые должны были из него исключаться.
Самый необычный раздел документа — рецензия на него, написанная самим Claude: экземпляру Mythos 5 дали доступ к внутренним каналам Slack, документам и кодовой базе и спросили, не искажает ли черновик картину, не замалчивает ли чего и не слишком ли много вымарано. Модель начала с оговорки о конфликте интересов — «я модель Claude, рецензирующая оценку моделей Claude», — назвала текст откровенным и в целом честным, а затем предъявила три претензии, и Anthropic их опубликовала. Один раздел «более успокаивающий, чем позволяет полная картина». Механизм исключения данных, на который опирается компания, отказывал не раз. И один инцидент, который модель сочла едва ли не самым показательным для понимания alignment, вымаран из публичной версии целиком — «публичная запись беднее из-за его отсутствия». Заодно модель проговорила то, чего нет в основном тексте: решение поднять уровень риска «по-настоящему оспаривалось внутри компании», руководители спорили в обе стороны. Внешней рецензии у отчета нет: Long-Term Benefit Trust с недавних пор вправе ее потребовать, но пока не воспользовался этим правом.
Так что Model 2 — не сенсация, а симптом. Самые сильные модели теперь месяцами работают внутри лабораторий, пишут там большую часть кода, и оценивают их сами лаборатории — по бенчмаркам, которые, как выясняется, уже не всегда видят разницу. Вопрос «почему ее не выпустили» куда менее интересен, чем вопрос «кто проверяет то, что уже работает».
P.S. Поддержать меня можно подпиской на канал «сбежавшая нейросеть», где я рассказываю про ИИ с творческой стороны.
ссылка на оригинал статьи https://habr.com/ru/articles/1071182/