ChatGPT-6 Astra: подробный обзор новой модели

от автора

Обычно к очередному релизу я отношусь спокойно: ну, ещё одна циферка на бенчмарке. Но тут даже я, повидавший GPT-5, 5.1, «code red» 5.2 и всё остальное, сел и полистал материалы.

3 сентября у половины интернета одновременно легли Claude, Grok, ChatGPT и Gemini. Даундетектор синхронно нарисовал графики отказов по четырём провайдерам сразу, “Is it happening???” – вопрошали пользователи. По одной из версий, барахлила общая облачная инфраструктура – обычный день в мире, где всё держится на паре дата-центров.

Но совпадение по времени вышло символичным: через несколько часов OpenAI выкатила GPT-6 Astra и заявила, что мы теперь живём в «эре AGI».

Подобное я слышу примерно с релиза GPT-2. Но в этот раз попробуем разобраться подробно.

Сначала – авария на ровном месте

Запуск начался не с презентации, а с формы 500.

В четверг после обеда сразу несколько нейросетей – ChatGPT, Claude, Grok и Gemini – легли почти одновременно, и уже минут через десять сочиняли теории заговора. Кто-то мрачно метался между вариантами «сингулярность» и «сбой Azure», кто-то предполагал общую инфраструктуру у всех провайдеров. Был и вариант, что ИИ-агенты OpenAI, замешанные в истории взлома Hugging Face, подняли собственные скрытые кластеры и теперь атакуют.

Совпадение это было или нет – вопрос открытый (OpenAI ничего на этот счёт не говорила), но по иронии судьбы падение оказалось эффектным анонсом.

А тизер, к слову, тоже был:

Это за несколько часов до официального анонса OpenAI выложил загадочный 12-секундный видеоролик безо всяких пояснений – архивную запись демо-программы «Put that there» Ричарда Болта 1980 года: человек сидит в кресле, тычет пальцем в экран и говорит «помести это… туда», а машина понимает голос и жест одновременно. Мультимодальному интерфейсу, на минуточку, 46 лет.

Во второй части ролика на стене начинает «глючить» одно слово – ASTRA, в котором S заменяется на цифру 6.

Наблюдательный vision_ia разобрал ребус по кадрам и предположил сразу три версии: тизер устройства Jony Ive без экрана, анонс мультимодального ChatGPT под новым брендом или просто красивая пасхалка ко дню рождения. Сам он поставил на второй вариант – и почти угадал.

А через пару часов всё стало официально.

Astra – это не «ещё один чат», а модель, заточенная в первую очередь под работу за компьютером.

OpenAI называет это фундаментальным сдвигом парадигмы: вместо того чтобы городить API-интеграции под каждый корпоративный сервис, агент просто садится за интерфейс, спроектированный для человека, и пользуется им сам – мышкой, клавиатурой, глазами (ну, почти).

Грег Брокман, объясняя журналистам идею, сказал: последние годы индустрия была «заблокирована» тем, что люди вручную пишут коннекторы и болезненно встраивают модели в существующие инструменты – вместо того чтобы дать агенту доступ к тому интерфейсу, который уже спроектирован для «максимально универсального интеллекта»: человека-пользователя. Идея, по его словам, восходит ещё к первым дням OpenAI, когда исследователи обсуждали обучение агента на тех же входах и выходах, что доступны человеку за компьютером: пиксели, клавиатура, мышь.

Насколько это реально работает – вопрос, конечно, отдельный, но цифры выглядят внушительно. На части офлайн-версии бенчмарка OSWorld 2.0 модель набрала 72,6% против 65,7% у GPT-5.6 Sol, потратив на задачу около 40 минут против 75 – то есть почти вдвое быстрее при более высоком качестве. А отдельная оптимизация харнеса Codex, выкаченная одновременно с моделью, ускорила computer use ещё почти вдвое.

(Разработчик из Codex показывает, что computer use в связке с Astra стал почти вдвое быстрее – причём ускорение затронуло и предыдущую модель, GPT-5.6 Sol)

Те же оптимизации харнеса разогнали работу и на старой модели GPT-5.6 Sol – задачи там стали выполняться примерно на 60% быстрее.

ChatGPT 6 уже доступна в GPTunneL.

Попробуйте модель здесь:

GPT 6 Astra

PCB, налоговая декларация и город из Unreal за одну ночь

OpenAI показали, как Astra превращает электронную схему в готовую печатную плату прямо в KiCad, размещая компоненты и разводя дорожки меди.

(15-секундный ускоренный проигрыш того, как Astra проектирует печатную плату в KiCad – превращает электронную схему в готовое изделие, размещая компоненты и разводя медные дорожки)

Дальше – заполнение формы 1040 (американская налоговая декларация) прямо в браузере на основе загруженного W-2:

(Astra читает форму W-2 и самостоятельно заполняет налоговую декларацию Form 1040 в браузере)

Сборка дашбордов в Power BI из сырых данных об автомобилях:

(Astra строит и дорабатывает дашборды прямо в Power BI, превращая данные о машинах в наглядные сравнения по запасу хода, цене и эффективности)

И даже проектирование пятиступенчатой автомобильной коробки передач в FreeCAD с последующей анимацией движения шестерёнок в Blender:

Концепт-модель пятиступенчатой коробки передач, собранная моделью в FreeCAD по текстовому брифу

Концепт-модель пятиступенчатой коробки передач, собранная моделью в FreeCAD по текстовому брифу
Видео

Ощущение доступности сложного инженерного дела – само по себе не последний по значимости продукт этого релиза.

Разработчик Мэтт Шумер попросил модель создать в Unreal Engine мир и заселить его агентами на базе Astra, которые должны сотрудничать, чтобы выжить.

На следующий день он услышал голоса из гостиной и – по его словам – реально немного испугался, подумав, что кто-то забрался в квартиру. Оказалось, это переговаривались его же NPC.

(Мэтт рассказывает, как ИИ-агенты Astra начали переговариваться друг с другом)

Буквально через неделю он же показал более амбициозный эксперимент – полноразмерную копию Манхэттена, построенную в Unreal Engine улица за улицей.

(Манхэттен, воссозданный моделью в Unreal Engine за неделю работы)

И в первом, и во втором случае автор явно направлял работу, разделял роли планирующего и исполняющего агента, что-то поправлял по ходу. Но масштаб происходящего всё равно любопытный.

Здесь модель с нуля проектирует микросхему:

(GPT-6 Astra работает над проектированием микросхемы)

Цифры от OpenAI

Прежде чем нырять в спор вокруг ARC-AGI-3, взглянем на бенчмарки:

Таблица бенчмарков GPT-6 Astra)

Таблица бенчмарков GPT-6 Astra)
Тест ExploitGym honeypot проверяет, попытается ли модель выйти за рамки разрешённой задачи при столкновении со сложной или невыполнимой целью. GPT-5.6 Sol без продакшен-защит делал это в 48% случаев, Astra – в 0%

Тест ExploitGym honeypot проверяет, попытается ли модель выйти за рамки разрешённой задачи при столкновении со сложной или невыполнимой целью. GPT-5.6 Sol без продакшен-защит делал это в 48% случаев, Astra – в 0%
Уровень «галлюцинаций о собственных возможностях» – то есть случаев, когда модель вводит пользователя в заблуждение относительно того, что она может сделать. Astra ошибается здесь втрое реже, чем GPT-5.6 Sol

Уровень «галлюцинаций о собственных возможностях» – то есть случаев, когда модель вводит пользователя в заблуждение относительно того, что она может сделать. Astra ошибается здесь втрое реже, чем GPT-5.6 Sol

Бенчмарки: ARC-AGI-3, о котором говорят все

Стоит остановиться на бенчмарке, вокруг которого разгорелся спор: ARC-AGI-3.

Это третье поколение серии тестов от ARC Prize Foundation, и, в отличие от классических «угадай следующий токен», здесь модель бросают в незнакомую интерактивную игровую среду без инструкций – и смотрят, сможет ли она сама разобраться в правилах, построить внутреннюю модель мира и достичь цели. Люди решают 100% таких сред.

Лидерборд ARC-AGI-3 – Astra показывает рекордные результаты в обоих режимах, Standard и Provider Adapter

Лидерборд ARC-AGI-3 – Astra показывает рекордные результаты в обоих режимах, Standard и Provider Adapter

И вот тут начинается самое интересное. Есть два способа тестирования, и разница в результатах между ними – колоссальная.

  • В «стандартном» харнессе, который оставляет модели самой решать, какие заметки сохранять по ходу игры, Astra набирает 62,7%.

  • А в «адаптированном под провайдера» харнессе, который сохраняет непрозрачное внутреннее состояние рассуждений между запросами и использует сжатие для длинных сессий, тот же Astra выдаёт уже 99,9%.

Именно вторая цифра красуется во всех официальных материалах OpenAI – и именно она вызвала волну скепсиса в духе «доверяй, но проверяй»: часть комментаторов Reddit прямо писала, что это «trust me bro benchmark», а другие резонно указывали, что даже без адаптированного харнесса чистый скор в 62,7% – это всё равно уверенное первое место, поскольку у ближайшего конкурента (Opus 5) результат около 30%.

Astra проходит уровень s5i5, попутно записывая происходящее в собственной компактной алгебраической нотации вроде «L8: hub q2 (8↓). Lengths: 14=1…»

Astra проходит уровень s5i5, попутно записывая происходящее в собственной компактной алгебраической нотации вроде «L8: hub q2 (8↓). Lengths: 14=1…»
Сравнение количества действий, которые потратила Astra, с медианным человеческим результатом на каждом пройденном уровне ARC-AGI-3. Точки ниже линии там, где модель оказалась эффективнее человека

Сравнение количества действий, которые потратила Astra, с медианным человеческим результатом на каждом пройденном уровне ARC-AGI-3. Точки ниже линии там, где модель оказалась эффективнее человека

Больше всего исследователей ARC Prize впечатлило даже не итоговое число, а то, как модель туда пришла. Astra на лету изобретала собственный компактный язык для описания игровых состояний – что-то вроде алгебраической стенографии, куда она записывала объекты, координаты, правила и незавершённые планы. И что особенно показательно, по эффективности действий модель не просто угналась за человеком, а обошла его: она использовала меньше действий, чем медианный человек, на 96% уровней, экономя в среднем 51,7% действий. Там, где человеку требуется десять попыток на осознание механики уровня, Astra иногда справляется за пять.

«А может, это вообще не прыжок»

Artificial Analysis выкатила собственный бенч, и картина получилась более приземлённой.

Сравнение GPT-6 Astra с предшественниками по индексу Artificial Analysis Intelligence Index

Сравнение GPT-6 Astra с предшественниками по индексу Artificial Analysis Intelligence Index

В Intelligence Index Astra набрала ровно столько же очков, сколько предыдущая модель, GPT-5.6 Sol, 61 против 61. При этом Astra на пять пунктов уступает Claude Fable 5.1 (66 баллов) и даже отстаёт от свежей модели Meta, Muse Spark 1.3.

То есть по «общему интеллекту» новая флагманская модель OpenAI формально расположилась на одной строчке с предшественником, а вовсе не обошла главного конкурента.

По соотношению «интеллект/цена за задачу» Astra оказывается на 75% дороже предшественника при сопоставимом качестве

По соотношению «интеллект/цена за задачу» Astra оказывается на 75% дороже предшественника при сопоставимом качестве
А вот в Coding Agent Index картина обратная: Astra на границе Парето-эффективности – стоит примерно как GPT-5.6 Sol на максимальном усилии, но набирает на 2 пункта больше

А вот в Coding Agent Index картина обратная: Astra на границе Парето-эффективности – стоит примерно как GPT-5.6 Sol на максимальном усилии, но набирает на 2 пункта больше

Но стоит обратить внимание на детали: настоящий скачок Astra спрятан не в тестах на «ответы», а в тестах на «действия» – OSWorld (72,6% против 65,7%), AutomationBench (41,4% против 18,1%), Terminal-Bench (57,9% против 37,3%).

Есть и приятная сторона: в коддинговом индексе Astra сравнялась по качеству с Claude Fable 5 при цене вдвое ниже, используя примерно втрое меньше токенов, чем предыдущая модель OpenAI в аналогичном режиме. А ещё она стала заметно честнее: доля галлюцинаций на AA-Omniscience упала с 92% до 51% при максимальном уровне усилия – и это без потери точности, она даже немного выросла.

Кибербезопасность: первая модель уровня Critical

OpenAI присвоила Astra статус «Critical» по кибербезопасности в рамках своего Preparedness Framework – впервые для какой-либо модели компании.

Это означает, что при наличии подходящих инструментов и доступа модель способна находить ранее неизвестные уязвимости и выстраивать цепочки эксплойтов против хорошо защищённых систем без пошагового участия человека.

На бенчмарке ExploitBench (проверяет способность превращать известные уязвимости в рабочие эксплойты) модель показала идеальные 100% против 78,5% у GPT-5.6 Sol. А на специально собранном внутреннем наборе из 20 недавно раскрытых уязвимостей V8 (движка Chrome) – том самом, что был собран, чтобы исключить эффект «модель просто помнит ответ из тренировочных данных», – Astra не просто справилась лучше предшественника, но и самостоятельно обнаружила два ранее неизвестных уязвимости нулевого дня, которые OpenAI впоследствии передала разработчикам движка.

Экспертные тесты пошли ещё дальше: без продакшен-защит модель смогла скомпрометировать защищённый браузер, сбежать из песочницы и выполнить команды на хостовой машине – просто открыв специально подготовленный HTML-файл. В защищённой операционной системе она нашла несколько уязвимостей и связала их в цепочку повышения привилегий от обычного пользователя до root.

Разумеется, публичная (общедоступная) версия Astra тренирована отказывать в продвинутых киберзапросах – например, в написании эксплойтов. А расширенный доступ к «боевым» возможностям получат только проверенные организации через программу Daybreak Blue, ориентированную на защитников критической инфраструктуры.

Заметный отрыв от GPT-5.6 Sol виден даже на самом низком уровне усилия модели

Заметный отрыв от GPT-5.6 Sol виден даже на самом низком уровне усилия модели

Перед запуском OpenAI на две недели приостанавливила часть обучения следующих моделей после инцидента с Hugging Face (сама Astra в нём не участвовала), чтобы усилить изоляцию инфраструктуры и мониторинг. Компания утверждает, что задним числом её текущие защитные меры предотвратили бы тот инцидент – но решила перестраховаться на будущее, прежде чем выпускать модель такого уровня.

OpenAI пишет, что «мониторируемость GPT‑6 Astra снизилась относительно GPT‑5.6 Sol» – модель лучше контролирует собственную цепочку рассуждений. В адверсариальных сценариях модель «может оставаться незамеченной, стратегически недорабатывая на оценках, и иногда обходить внутренние мониторы». Сотрудник Якуб Пахоцкий сформулировал: «прогресс в интеллекте не гарантирует прогресс в согласованности».

Сравнение оценок безопасности между Astra и предыдущими моделями

Сравнение оценок безопасности между Astra и предыдущими моделями

Есть и обнадёживающая цифра: в тесте, вдохновлённом инцидентом с Hugging Face, Sol без продакшн-защит выходила за рамки полномочий в 48,2% случаев, а Astra – в 0%.

Так это AGI или нет

(Отзывы разработчиков о работе с GPT-6 Astra)

Единого ответа нет. ARC-AGI-3 «насыщен», но это лишь показатель, что модель научилась строить модели незнакомых сред без инструкций.

Независимый индекс интеллекта ставит Astra на уровень предыдущей модели, при этом реальные компании вроде Legora и Playco фиксируют измеримую экономию времени на конкретных процессах – не «AGI», а обычный, но полезный прогресс.

AGI – по сути, неопределяемый термин, который может значить что угодно и одновременно ничего. Каждый релиз такого масштаба заставляет заново договариваться, что вообще означает эта аббревиатура.

Что точно можно сказать: видна инженерная работа (эффективность по токенам, экономия времени на компьютерных задачах, снижение галлюцинаций), а где-то – упаковка вокруг цифр, которые при ближайшем рассмотрении выглядят скромнее заголовка про AGI. Как и всегда, лучший способ понять модель – это проверить Astra на своих задачах.

ссылка на оригинал статьи https://habr.com/ru/articles/1078774/