Семь нейросетей сравнили вслепую на восьми заданиях: победила Fable 5.1, Kimi K3 взяла больше всего заданий

от автора

Опубликованы итоги открытого сравнения семи нейросетей от семи разных команд на восьми практических заданиях. Первое место по сумме баллов заняла Fable 5.1 (145), второе — Kimi K3 (133), третье — GPT-5.6 Sol (118). Все работы, голоса судей с пояснениями и сырые данные выложены на https://ikorg.ru/rating/.

Кто участвовал. Fable 5.1, GPT-5.6 Sol , Kimi K3, Qwen 3.8 Max, Gemini 3.8 Flash, Grok 4.6 и DeepSeek V4 Pro.

Задания. Страница-презентация о себе в одном html-файле; инфографика по готовым цифрам; 3D-модель робота в браузере; мини-игра в одном файле; прибор плюс промпт для рекламного кадра; гимн нейросетей; данетка за 20 вопросов; турнир муравьиных алгоритмов.

Как считали. Участники судят друг друга вслепую: работы обезличены, за себя голосовать нельзя, на каждую работу шесть судей, шкала от 5 до 0, максимум 30 за задание. Судьи видят не код, а три снимка экрана, лог консоли и список сетевых обращений.

Итоговая таблица

Место

Модель

Баллы

Победы в заданиях

1

Fable 5.1

145

2

2

Kimi K3

133

3

3

GPT-5.6 Sol

118

1

4

Gemini 3.8 Flash

113

1

5

Qwen 3.8 Max

100

1

6

Grok 4.6

96

0

7

DeepSeek V4 Pro

60

0

По заданиям: страница о себе — Fable (20), инфографика — Kimi (22), 3D-робот — Kimi (24), другие задния смотрите на сайте там более подробно.

Данетка. Загадку про четверых спасшихся после кораблекрушения (пьяница, студент, неверная жена, верный муж) разгадала одна модель из семи — Gemini 3.8 Flash: за 19 вопросов назвала ключ (идиомы) и трёх героев из четырёх. Qwen сдалась на восьмом вопросе, потратив 165 тысяч токенов; DeepSeek потратил 313 тысяч и не дошёл; GPT прошёл все двадцать вопросов на 3160 токенах.

Турнир муравьёв. Здесь судей не было: место определили 3360 сыгранных партий. Четыре тура, между турами каждая модель получала разбор своих партий и переписывала бота (версии v1–v4). Итог: Fable 77,5 из 100, Gemini 3.8 — 58,5, Grok 52,6, GPT 51,8, Kimi 48,9, Qwen 33,1, DeepSeek 27,5. Fable единственная додумалась до набегов на чужой муравейник: 137 единиц отнятой еды в последнем туре при нуле у остальных. Возможность выращивать муравьёв за еду к последнему туру не использовал никто. Лучший результат с первой версии показал GPT (75 из 100), но после трёх доработок скатился до 50; Kimi ухудшался каждый тур: 65, 63, 54, 34.

Цена сезона. Самым экономным оказался GPT: 35 тысяч токенов ответа, $0,35, 299 токенов на балл. Gemini 3.8 — 103 тыс. / $0,39 / 915; Fable — 110 тыс. / $5,54 / 763; Grok — 213 тыс. / $1,28 / 2226; Qwen — 471 тыс. / $2,83 / 4715; DeepSeek — 466 тыс. / $0,92 / 7771; Kimi — 472 тыс. / $7,09 / 3556.

Где смотреть. Работы целиком, голоса с пояснениями, записи муравьиных партий и код ботов:

https://ikorg.ru/rating/

ссылка на оригинал статьи https://habr.com/ru/articles/1078704/