Группа из 64 математиков — профессора, постдоки, аспиранты и медалисты международных олимпиад — создала бенчмарк SOOHAK из 439 задач исследовательского уровня. Каждая задача написана с нуля, без использования ИИ, и прошла пятиступенчатую проверку: от автоматического скрининга до ручного аудита. Бюджет проекта — $550 000 из средств Министерства науки Южной Кореи. Лучшая модель, Gemini 3 Pro, решает лишь 30% задач основного подмножества Challenge.
GPT-5 набрала 26,4%, Claude Opus 4.5 — 10,4%. Открытые модели отстают еще сильнее: лучший результат среди них — 13,9% у Kimi-2.5, а Qwen3-235B и GPT-OSS-120B не дотягивают до 12%. При этом на более легком подмножестве SOOHAK-Mini, где собраны олимпиадные задачи и задачи уровня бакалавриата, разрыв между закрытыми и открытыми моделями куда меньше — GPT-5 набирает 72%, Kimi-2.5 — 66%. Провал начинается именно там, где математика выходит за пределы опубликованных учебников и статей.
Но, пожалуй, самая интересная часть бенчмарка — подмножество Refusal из 99 задач. Это задачи-ловушки: некорректно поставленные, с противоречивыми условиями или без единственного ответа. Правильная реакция модели — отказаться решать и объяснить, в чем проблема. Ни одна модель не преодолела порог в 50%. Лучший результат показала открытая GLM-5 (49,5%), обогнав все закрытые системы. А семейство Qwen3 оказалось аутсайдером — модели упорно пытались решить нерешаемое, выдавая уверенные, но бессмысленные ответы.

Для калибровки результатов авторы собрали пять команд из 25 человек — от золотых медалистов IMO до PhD-исследователей — и дали им 4,5 часа на 79 задач. Суммарное покрытие всех команд — 50,6%. Единственная модель, которая превысила этот порог, — Gemini-3-Pro с 60,8%. Любопытно, что олимпиадники с математическим образованием решали лучше PhD-исследователей: формат бенчмарка с жестким дедлайном награждает скорость, а не глубину специализации.
Для индустрии это сигнал: олимпиадная математика для топовых моделей уже почти решена, а вот задачи исследовательского уровня — и особенно умение отказываться решать то, что решить нельзя, — остаются за горизонтом.
P.S. Поддержать меня можно подпиской на канал «сбежавшая нейросеть«, где я рассказываю про ИИ с творческой стороны.
ссылка на оригинал статьи https://habr.com/ru/articles/1036262/