Опубликованы итоги открытого сравнения семи нейросетей от семи разных команд на восьми практических заданиях. Первое место по сумме баллов заняла Fable 5.1 (145), второе — Kimi K3 (133), третье — GPT-5.6 Sol (118). Все работы, голоса судей с пояснениями и сырые данные выложены на https://ikorg.ru/rating/.
Кто участвовал. Fable 5.1, GPT-5.6 Sol , Kimi K3, Qwen 3.8 Max, Gemini 3.8 Flash, Grok 4.6 и DeepSeek V4 Pro.
Задания. Страница-презентация о себе в одном html-файле; инфографика по готовым цифрам; 3D-модель робота в браузере; мини-игра в одном файле; прибор плюс промпт для рекламного кадра; гимн нейросетей; данетка за 20 вопросов; турнир муравьиных алгоритмов.
Как считали. Участники судят друг друга вслепую: работы обезличены, за себя голосовать нельзя, на каждую работу шесть судей, шкала от 5 до 0, максимум 30 за задание. Судьи видят не код, а три снимка экрана, лог консоли и список сетевых обращений.
Итоговая таблица
|
Место |
Модель |
Баллы |
Победы в заданиях |
|---|---|---|---|
|
1 |
Fable 5.1 |
145 |
2 |
|
2 |
Kimi K3 |
133 |
3 |
|
3 |
GPT-5.6 Sol |
118 |
1 |
|
4 |
Gemini 3.8 Flash |
113 |
1 |
|
5 |
Qwen 3.8 Max |
100 |
1 |
|
6 |
Grok 4.6 |
96 |
0 |
|
7 |
DeepSeek V4 Pro |
60 |
0 |
По заданиям: страница о себе — Fable (20), инфографика — Kimi (22), 3D-робот — Kimi (24), другие задния смотрите на сайте там более подробно.
Данетка. Загадку про четверых спасшихся после кораблекрушения (пьяница, студент, неверная жена, верный муж) разгадала одна модель из семи — Gemini 3.8 Flash: за 19 вопросов назвала ключ (идиомы) и трёх героев из четырёх. Qwen сдалась на восьмом вопросе, потратив 165 тысяч токенов; DeepSeek потратил 313 тысяч и не дошёл; GPT прошёл все двадцать вопросов на 3160 токенах.
Турнир муравьёв. Здесь судей не было: место определили 3360 сыгранных партий. Четыре тура, между турами каждая модель получала разбор своих партий и переписывала бота (версии v1–v4). Итог: Fable 77,5 из 100, Gemini 3.8 — 58,5, Grok 52,6, GPT 51,8, Kimi 48,9, Qwen 33,1, DeepSeek 27,5. Fable единственная додумалась до набегов на чужой муравейник: 137 единиц отнятой еды в последнем туре при нуле у остальных. Возможность выращивать муравьёв за еду к последнему туру не использовал никто. Лучший результат с первой версии показал GPT (75 из 100), но после трёх доработок скатился до 50; Kimi ухудшался каждый тур: 65, 63, 54, 34.
Цена сезона. Самым экономным оказался GPT: 35 тысяч токенов ответа, $0,35, 299 токенов на балл. Gemini 3.8 — 103 тыс. / $0,39 / 915; Fable — 110 тыс. / $5,54 / 763; Grok — 213 тыс. / $1,28 / 2226; Qwen — 471 тыс. / $2,83 / 4715; DeepSeek — 466 тыс. / $0,92 / 7771; Kimi — 472 тыс. / $7,09 / 3556.
Где смотреть. Работы целиком, голоса с пояснениями, записи муравьиных партий и код ботов:
ссылка на оригинал статьи https://habr.com/ru/articles/1078704/