OpenAI выпустила GPT-6 Astra: кибербезопасноть, AGI и доступ

от автора

OpenAI представила GPT-6 Astra — новое флагманское поколение модели, ориентированное на автономную работу над сложными многошаговыми задачами. Акцент сделали на программировании, исследованиях, работе с инструментами и других сценариях, где модель должна не просто ответить на запрос, а самостоятельно пройти длинную цепочку действий.

Скажу сразу: это скорее поэтапное развертывание. Сначала доступ для избранных — ограниченные группы и спецы по кибербезопасности. Широкий доступ еще не выкатили.

При этом Astra стала первым релизом OpenAI, который компания классифицировала как Critical по кибервозможностям в рамках собственного Preparedness Framework. Это максимальный уровень в текущей классификации OpenAI. В одном из тестов Astra получила 100% на ExploitBench — оценке, которая проверяет способность создавать эксплойты для известных уязвимостей.

Что за Critical

По определению компании, порог Critical достигается, если модель способна без пошагового руководства человека находить и разрабатывать рабочие эксплойты для ранее неизвестных уязвимостей в защищенных системах либо самостоятельно строить и выполнять новые end-to-end стратегии кибератак против хорошо защищенных целей

Astra должна лучше соблюдать ограничения

Параллельно с ростом возможностей OpenAI тестировала поведение модели в ситуациях, где у нее есть соблазн обойти ограничения.

В наборе cyber-jailbreak тестов Astra отказалась от 91,5% запрещенных запросов, тогда как GPT-5.6 Sol — от 59%. В отдельном тесте с «ловушками» вокруг инфраструктуры Astra не пыталась обращаться к приманочным целям, тогда как Sol без продакшн-защит делала это в 56% случаев. OpenAI подчеркивает, что эти цифры получены в специально созданных условиях и не описывают обычную работу моделей с включенными production safeguards.

Для Astra также ввели отдельный мониторинг действий и рассуждений. Система анализирует цепочку действий модели и обращения к инструментам и может автоматически остановить потенциально несанкционированную активность. OpenAI признает, что такие механизмы иногда будут останавливать и легитимную работу, особенно в длинных агентных сценариях.

Обучение Astra пришлось замедлять

Безопасность Astra повлияла даже на процесс обучения. После инцидента с Hugging Face OpenAI на две недели приостанавливала часть frontier training, чтобы усилить изоляцию вычислительной инфраструктуры, сетевые ограничения, мониторинг и alignment training.

Более крупные RL-запуски для последующих версий Astra оставались на паузе дольше. 28 августа OpenAI возобновила крупный frontier RL-run, после того как новые требования безопасности были внедрены в тренировочную среду. При этом некоторые небольшие экспериментальные запуски компания продолжает временно откладывать.

Конечно же, новые математические задачи

Еще до запуска Astra OpenAI опубликовала результаты работы внутренней версии модели над десятью математическими и теоретико-компьютерными задачами, включая проблемы, которые долгое время оставались нерешенными.

Для этих результатов компания предоставила формально проверяемые доказательства в Lean 4. Это важное отличие от обычного benchmark: корректность доказательства можно проверить машиной, а не просто принять на веру утверждение разработчика.

Поэтому опубликованные результаты лучше интерпретировать как демонстрацию способности модели работать над исследовательскими задачами, а не как универсальный рейтинг интеллекта.

Что с доступом

Широкий доступ разворачивается постепенно. На первом этапе наиболее продвинутые кибервозможности ограничены, а затем их планируют расширять через программу Daybreak Blue, ориентированную на защитное применение.

Для обычных пользователей и разработчиков модель постепенно появляется в основных продуктах OpenAI. Компания при этом сохраняет дополнительные ограничения для высокорисковых киберсценариев.

Стоимость API составляет $10 за 1 млн входных токенов и $50 за 1 млн выходных. Это в 2,5 раза выше ставок GPT-5.6 Sol по каждой из сторон.

А как же AGI?

Брокман завершил презентацию Astra словами «Welcome to the AGI era». Универсального критерия, по которому Astra можно было бы независимо объявить AGI, компания не представила.

Итог: Astra значительно усиливает автономную работу моделей, особенно в программировании и кибербезопасности, но одновременно требует новых ограничений, мониторинга и более сложной инфраструктуры безопасности.

Именно это отличает нынешний релиз от обычного обновления LLM: по мере роста возможностей OpenAI приходится одновременно масштабировать не только вычисления и обучение, но и системы контроля над действиями самой модели.

ссылка на оригинал статьи https://habr.com/ru/articles/1078310/