За неделю команда бенчмарка Design Arena выпустила два разбора моделей, возглавивших ее дизайн-лидерборды: разбор GPT-5.6 Sol, флагмана OpenAI, и свежий разбор Kimi K3 от китайской Moonshot AI. Исследователи заглянули внутрь генераций и рассуждений моделей и показали, как именно те научились «вкусу». Выяснилось, что универсального рецепта нет: две модели пришли к хорошему дизайну противоположными путями, а третья — прошлый лидер GLM 5.2 — своим, третьим.
Design Arena — это слепые сравнения: люди получают два сайта, сгенерированных разными моделями по одному запросу, и голосуют за тот, что нравится больше. Из голосов складывается Elo-рейтинг. Именно такие арены в свое время и зафиксировали феномен «типичного ИИ-дизайна» — узнаваемый набор штампов, по которым сгенерированный сайт видно за секунду: фиолетово-синие градиенты, bento-сетки из скругленных карточек, гигантская типографика вместо большой заглавной картинки, сетка-подложка на фоне. У Design Arena для этого есть термин «design smells», и еще три месяца назад ими страдала GPT-5.5.
После релиза GPT-5.6 Sol заняла первое место на арене Web Design (Non-Agentic) с Elo 1353 — на 18 позиций выше предшественницы GPT-5.5. Для OpenAI это первый выход на вершину дизайн-лидерборда, причем модель попутно задала два новых Парето-фронта: среди моделей с сопоставимым рейтингом нет ни столь же быстрых, ни столь же дешевых. Sol генерирует дизайны в 2,44 раза быстрее прошлого лидера GLM 5.2 и на 36% быстрее Claude Fable 5, а стоит $5/$30 за миллион токенов против $10/$50 у модели Anthropic.
Чтобы понять, что изменилось, исследователи взяли 1000 сайтов, сгенерированных Sol, превратили каждый в CLIP-эмбеддинг — числовой «отпечаток», в котором похожие дизайны оказываются рядом, — и спроецировали все это в двумерное пространство алгоритмом UMAP. Получилась карта области, которую занимают генерации модели. И на этой карте обнаружились странные дыры: пустые зоны, окруженные генерациями со всех сторон. У других моделей таких дыр нет — их дизайн-пространства сплошные, вариативность в них задается только запросом пользователя.

Расшифровать дыры помогло наложение: исследователи поместили генерации GPT-5.5 и Sol в общее пространство эмбеддингов, раскрасив первые синим, вторые оранжевым. Почти всюду облака точек перекрываются — модели в целом рисуют похожие сайты. Но есть кластер, где оранжевых точек нет вовсе: сайты с фиолетовыми градиентами. Тот же эффект нашелся для bento-сеток, гигантской типографики и смещенных (offset) композиций. Вывод исследователей: Sol выучила ИИ-антипаттерны — сама форма дыр выдает, что модель знает эти области дизайн-пространства, — но отказывается генерировать их содержимое. Модель знает, как выглядит «типичный ИИ-дизайн», и активно его подавляет.
Для контраста — GLM 5.2, которая решила ту же задачу иначе: она избегает антипаттернов, потому что, судя по всему, вообще их не выучила. Модель работает от набора удачных шаблонов, в которых штампов пока просто нет (в сети не так много сайтов, сделанных GLM-5.2), поэтому и дыр в ее пространстве не возникает. Подавление у Sol при этом работает не на все: конфетти появляется в 26,5% ее генераций — модель даже пишет собственные библиотеки конфетти, когда готовых нет под рукой. С графиками у Sol тоже не сложилось: реалистичные диаграммы через chart.js ей не даются.
Второй разбор — про Kimi K3, которая заняла первое место на single-shot Frontend Arena с Elo 1408, поднявшись на 10 позиций относительно Kimi K2.6. Это крупнейший скачок в истории линейки Moonshot, а на этой неделе модель взяла еще и первое место на арене 3D-дизайна с Elo 1450, опередив Claude Fable 5. Внимание исследователей привлекла аномалия: на простых одношаговых фронтенд-задачах K3 тратит почти в 4 раза больше токенов размышлений, чем Kimi K2.7 Code. Команда полезла в цепочки рассуждений выяснять, о чем модель столько думает.
Оказалось, K3 симулирует внутри цепочки рассуждений работу полноценного ИИ-агента. Ее рассуждения многостадийны: планирование, принятие решений, затем проектирование отдельных компонентов сайта — с итерациями и «мысленным тестированием» вместо реальных тестов, которые были бы у агента в настоящем цикле. По подсчетам на выборке из 3000+ генераций, K3 пишет в рассуждениях в 10 раз больше кода, чем любая другая модель линейки Kimi, — токенов кода в ее размышлениях больше, чем собственно размышлений. Модель думает таким образом: выражает план в виде конкретного кода и ограничений, а не расплывчатого наброска, сознательно разменивая скорость и токены на качество результата.

У этой стратегии нашелся неожиданный козырь — выученный «индекс интернета». Чтобы понять трюк, нужно знать, как картинки вообще попадают на сгенерированные сайты: модель их не рисует, а вставляет в код ссылку на чужое фото, обычно с бесплатного фотостока Unsplash. Такая ссылка содержит длинный ID конкретного снимка — и чтобы вместо картинки на сайте не красовался серый квадрат, ID должен указывать на реально существующее и подходящее по смыслу фото. Агент с инструментами просто нашел бы его поиском, но на одношаговой арене поиска нет, поэтому модели обычно либо вписывают ID наугад и получают битую картинку, либо сразу ставят заглушку.
K3 идет третьим путем: она вспоминает ID наизусть. За время обучения модель видела столько интернета, что связки вида «этот ID — фото заката над горами» записаны прямо в ее весах. В рассуждениях это разворачивается в плотный цикл «предложил — перепроверил»: модель решает, какая картинка ей нужна, с ходу выдает ID, а затем сама же оценивает, помнит ли она такой снимок и подходит ли он по смыслу — и если сомневается, пробует другой. Настоящей проверки тут нет: сходить по ссылке модель не может и сверяется с собственной памятью — как человек, который проговаривает набранный по памяти номер телефона, прежде чем позвонить. Но память K3 на интернет оказалась настолько хорошей, что в разобранных примерах у нее не нашлось ни одной битой или нерелевантной картинки, тогда как Claude Fable 5 и Kimi K2.7 Code на тех же задачах местами скатывались в alt-тексты и заглушки. Тот же прием работает и с зависимостями: K3 продумывает использование библиотек для скролл-анимаций и графиков прямо в рассуждениях.
Важная оговорка: лидерборды у героев разные — Sol первая на Web Design (Non-Agentic), K3 на single-shot Frontend Arena, — так что вывода «K3 победила Sol» из этих разборов не следует. Следует другое: на одном бенчмарке сосуществуют три рабочие стратегии дизайн-вкуса, каждая со своей ценой. GLM 5.2 не выучила плохое — дешево, но шаблонно. Sol выучила и подавляет, оставаясь быстрой и дешевой. K3 итерирует в голове — и платит за это временем и токенами.
P.S. Поддержать меня можно подпиской на канал «сбежавшая нейросеть», где я рассказываю про ИИ с творческой стороны.
ссылка на оригинал статьи https://habr.com/ru/articles/1062478/