Наш бенчмарк ИИ-агентов: собачьи бега моделей LLM, в которых Алиса выигрывает

от автора

Всем привет. На связи Сергей Игнатенко, основатель ИИ-платформы VibePilot.

Мы тут сделали свой бенчмарк моделей ИИ, которые работают внутри наших ИИ-агентов.

Почему вообще возникла эта задача

Дело в том, что наши ИИ-агенты работают на суверенных моделях Яндекса (Alice AI LLM, YandexGPT 5 Pro) уже с апреля этого года. Традиционно считается, что это слабые модели, которые не приспособлены для агентных сценариев. Благодаря проработанной архитектуре мы добились того, что слабые модели делают сложные задачи. Чтобы это доказать и показать, и была сделана страница.

Другого способа сравнить китайские и отечественные LLM в прикладной работе просто не существует. Независимые бенчмарки публикуют сравнение на традиционных задачах: алгоритмы, математика, программирование, ответы на вопросы. Мне эти сравнения неинтересны. Мне интересно другое: если поставить модели задачу «смета на ремонт квартиры 60 м² с разбивкой по разделам», получу ли я на выходе нормальный .xlsx, за сколько секунд и за сколько рублей. Это и есть ежедневные задачи VibePilot: генерация Word, Excel, презентаций и сайтов.

Что именно мы считаем и почему это не «ещё один LLM-бенчмарк»

Ключевое отличие от академических тестов: у нас модель никогда не отвечает «в вакууме». Она работает как полноценный агент с инструментами внутри конвейера, и конвейер для всех моделей один и тот же.

Для документов и таблиц конвейер состоит из трёх шагов: проверка вложений, генерация содержимого, проверка структуры. Для сайтов из четырёх: изучение задачи, выбор стека, сборка страницы, проверка вёрстки. Каждый шаг ограничен по инструментам, по числу итераций и по цели. Модель не решает, что делать дальше; она решает только, что написать на этом шаге.

Отсюда три метрики, которые мы считаем:

  1. Сбой. Задача не дошла до готового файла. Не «ответ так себе по мнению другой нейросети», а именно отсутствие результата после всех ретраев конвейера.

  2. Время. От старта до готового файла, включая все запросы к модели и все проверки.

  3. Стоимость. Реальный расход токенов по тарифу провайдера, в рублях за задачу.

Задачи настоящие, из повседневной работы пользователей: сметы, акты, договоры, коммерческие предложения, многостраничные таблицы Excel с формулами, презентации, лендинги с формой заявки. Ни одной синтетической.

Лидерборд за 3 месяца

Лидерборд, вкладка «За 3 месяца»

Лидерборд, вкладка «За 3 месяца»

1 198 задач, 22 сбоя, 1,8%. Шесть моделей в рейтинге.

Модель

Провайдер

Задач

Сбоев

Среднее время

Токены (ср.)

Стоимость

DeepSeek V4

DeepSeek (прямой API)

18

0,0%

2 мин 27 сек

1,9K

1,32 ₽

DeepSeek V3.2

DeepSeek (прямой API)

44

0,0%

3 мин 15 сек

1,4K

0,13 ₽

YandexGPT 5 Pro

Yandex Cloud

322

1,2%

2 мин 52 сек

3,6K

4,43 ₽

Qwen3-235B

Yandex Cloud

210

1,9%

4 мин 25 сек

3,4K

2,22 ₽

DeepSeek V4

Yandex Cloud

273

2,2%

4 мин 09 сек

3,5K

2,47 ₽

Alice AI LLM

Yandex Cloud

331

2,4%

2 мин 39 сек

3,0K

2,60 ₽

Сразу про то, что бросается в глаза.

Нули у DeepSeek напрямую ничего не значат. 18 и 44 задачи против 200–330 у моделей в Yandex Cloud. При n = 18 один сбой уже даёт 5,5%. Мы показываем размер выборки в каждой строке именно для того, чтобы никто не делал выводов по этим двум строкам. Прямой API DeepSeek у нас в конце цепочки фолбэков, поэтому и задач туда попадает мало.

Одна и та же модель через разных провайдеров даёт разные цифры. DeepSeek V4 через Yandex Cloud: 273 задачи, 2,2% сбоев, 4 мин 09 сек. Через прямой API: 18 задач, 0%, 2 мин 27 сек. Разница во времени почти в два раза. Тут и разные версии развёртывания, и разные лимиты, и разная нагрузка на инференс. Вывод из этого не «облако портит модель», а «сравнивать надо не модели, а конкретные модели у конкретных провайдеров». Что мы и делаем.

Разброс по стоимости почти в 35 раз. От 0,13 ₽ у DeepSeek V3.2 напрямую до 4,43 ₽ у YandexGPT 5 Pro. Это средние по всем типам задач; на конкретной задаче расклад может быть совсем другим, что хорошо видно в забегах ниже.

Забеги: четыре живых примера

Лидерборд показывает статистику. Забег показывает конкретику: одна задача, две модели, параллельно, через один и тот же конвейер. Я прогнал четыре задачи, которые честно взяты из того, что люди делают в платформе каждый день.

1. Смета на ремонт: Alice Ai LLM против Qwen3-235B

Задача: смета на ремонт квартиры 60 м², разделы (демонтаж, электрика, сантехника, штукатурка и стяжка, чистовая отделка), в каждой строке наименование, единица измерения, количество, цена, сумма, итоги по разделам и общий итог.

https://vibepilot.ru/benchmark/race/race-37cdb4ae3d38

Alice AI LLM

Qwen3-235B

Время

19 сек

1 мин 27 сек

Запросов к модели

2

5

Токенов

385

1 182

[скрин: забег «Смета на ремонт квартиры 60 м²»]

Разрыв в четыре с половиной раза по времени и в три раза по токенам. При этом структура у Алисы даже аккуратнее: она сделала заголовки разделов отдельными строками (ДЕМОНТАЖ, ЭЛЕКТРИКА) и под каждым итог «Итого по демонтажу». Qwen обошёлся строками «Итого: Демонтаж» без выделенных заголовков разделов, то есть визуально смета читается хуже.

Обратите внимание на пять запросов к модели у Qwen против двух у Алисы. Это конвейер отрабатывал уточнения: модели не хватило одного прохода, чтобы выдать структуру, которую примет валидатор. На стоимость это влияет напрямую.

2. Учёт расходов кафе: DeepSeek V4 против YandexGPT 5 Pro

Задача: три листа по месяцам плюс сводный, шесть категорий расходов, на сводном суммы через SUMIF со ссылкой на месячные листы, доля каждой категории в процентах и график.

https://vibepilot.ru/benchmark/race/race-5b93403d272f

DeepSeek V4 (Yandex Cloud)

YandexGPT 5 Pro

Время

46 сек

20 сек

Таблиц (листов)

4

4

Токенов

461

810

Забег «Учёт расходов кафе»

Забег «Учёт расходов кафе»

Оба справились с многолистовой структурой: Июль, Август, Сентябрь, Сводный. YandexGPT быстрее вдвое.

Но вот интересное. На месячном листе DeepSeek сделал три колонки: категория, сумма, доля в процентах с формулой вида =B2/$B$7. YandexGPT на том же листе сделал две: статья и сумма. Формально задание про доли относилось к сводному листу, так что придраться не к чему, но разница в подходе видна: одна модель распространила требование на все листы, другая выполнила его буквально там, где оно написано.

Это, кстати, общая черта суверенных моделей, которую я вижу постоянно: если не перечислить пункты явно, документ будет сделан по минимуму. И Алиса, и YandexGPT Pro охотно упрощают. Хорошая новость в том, что лечится это одной строчкой в промпте, а не сменой модели.

3. Личные финансы: Alice против GigaChat 2 Max

Задача: доходы и расходы по категориям, остаток на конец месяца, процент от дохода, условное форматирование при превышении лимита.

https://vibepilot.ru/benchmark/race/race-80df1ab3f653

Alice AI LLM

GigaChat 2 Max (SberCloud)

Время

41 сек

28 сек

Запросов к модели

5

4

Ошибочных запросов

0

3

Токенов

828

182

забег «Учёт личных финансов»

забег «Учёт личных финансов»

Формально победил GigaChat: 28 секунд против 41. По нашей метрике победитель определяется по времени до готового файла, и это ровно тот случай, когда метрика вводит в заблуждение.

Что на самом деле в файлах. Алиса сделала колонку «Лимит» (о которой в задании было только косвенно, через условное форматирование), остаток на конец месяца формулой =B1-SUM(B2:B6) и добавила круговой график распределения расходов по категориям, хотя графика в задании не было вообще. GigaChat сделал плоскую таблицу доход/расход/процент/остаток с итоговой строкой, без графика и без лимитов.

И три ошибочных запроса из четырёх у GigaChat. Задача до результата дошла, конвейер вытянул, но с третьей попытки. У Алисы ноль ошибочных при пяти запросах.

Так что «GigaChat выиграл» здесь означает только «GigaChat быстрее выдал более простой файл».

4. Коммерческое предложение: GigaChat 2 Max против Alice

Задача: КП от студии дизайна интерьера, семь разделов перечислены явно (о компании, этапы работы, что входит в услугу, сроки, стоимость по этапам, условия оплаты, контакты), тон деловой, но не сухой.

GigaChat 2 Max (SberCloud)

Alice AI LLM

Время

3 мин 48 сек

45 сек

Запросов к модели

8

5

Ошибочных запросов

1

0

Страниц

1

2

Забег «Коммерческое предложение»

Забег «Коммерческое предложение»

Пятикратный разрыв по времени, и на этот раз он совпал с разрывом по содержанию.

GigaChat уложился в одну страницу. Раздел «О компании» целиком: одно предложение про то, что студия занимается дизайном интерьеров более десяти лет. Этапы работы: два пункта, консультация и подготовка эскиза. В таблицу стоимости попала одна строка. Плюс один ошибочный запрос по дороге и восемь обращений к модели.

Алиса за 45 секунд выдала две страницы: таблицу стоимости по этапам с цифрами и сроками (дизайн-проект, комплектация, авторский надзор, итого 343 750 ₽ и 4 месяца), условия оплаты разбивкой 30/40/30, контакты отдельной таблицей.

Разделы в задании были перечислены явно в обоих случаях. То есть дело не в промпте: GigaChat 2 Max на документах с разделами пока заметно уступает. Есть куда расти.

Почему Алиса выигрывает, хотя по проценту сбоев она последняя

Теперь можно честно объяснить заголовок.

По доле сбоев Alice AI LLM на последнем месте среди шести: 2,4%, 8 сбоев на 331 задачу. Но посмотрите на соседние столбцы: среднее время 2 мин 39 сек, лучшее среди моделей в Yandex Cloud, и 2,60 ₽ за задачу при самой большой выборке. А в забегах она выигрывает большинство задач по документам Word и уверенно держится в Excel.

Акт выполненных работ: Алиса 18 секунд, DeepSeek V4 через Yandex Cloud 42 секунды. Договор аренды квартиры: 22 секунды. Смета на 60 м²: 19 секунд против полутора минут у Qwen. Коммерческое предложение: 45 секунд против почти четырёх минут у GigaChat.

Для документа, где нужно быстро выдать структурно правильный текст по шаблону, Алиса на голову быстрее и дешевле всех. А 2,4% сбоев конвейер закрывает ретраем на другую модель в цепочке, и пользователь этого обычно не видит.

Где Алиса не выигрывает: лендинги. Там четыре этапа, генерация HTML и CSS, проверка вёрстки, и вот тут лидер уже YandexGPT 5 Pro. Сайт стоматологии с формой заявки: YandexGPT 5 Pro за 1 мин 25 сек и 9 запросов к модели, Qwen3-235B за 4 мин 51 сек и 14 запросов. Причём Qwen сделал более красивую страницу, с hero-блоком и нормальной типографикой, а YandexGPT выдал честный список ссылок и фото.

[скрин: забег «Сайт стоматологии», Qwen3-235B vs YandexGPT-5-Pro]

Так что «Алиса выигрывает» это не «Алиса лучшая модель». Это «внутри жёсткого конвейера самая быстрая и дешёвая российская модель побеждает на самом массовом типе задач». Год назад я бы в это не поверил.

Что реально влияет на результат: детализация промпта

Главный практический вывод из этих четырёх забегов даже не про модели.

И Алиса, и YandexGPT Pro, и GigaChat склонны к упрощению: если в задании не перечислить разделы и пункты, документ будет сделан по минимуму. Смета выйдет плоским списком без разделов, КП уместится в полстраницы, в Excel не будет ни процентов, ни условного форматирования.

Но стоит перечислить пункты явно, и разрыв между моделями по содержанию сжимается почти до нуля; остаётся разрыв по скорости и цене. В забеге со сметой разделы были перечислены, и обе модели их сделали, вопрос был только в 19 секундах против 87. В забеге с личными финансами формулировка была общей, и тут модели разошлись сильно: Алиса дорисовала лимиты и график, GigaChat ограничился минимумом.

Для практики это означает простую вещь: в связке «конвейер плюс суверенная модель» качество результата определяется в первую очередь тем, насколько подробно поставлена задача. Выбор модели решает, сколько вы заплатите и сколько будете ждать.

Почему сбоев 1,8%, а не 12–37%

В индустрии для ИИ-агентов со свободным циклом называют 12–37% брака. У нас 1,8% на тех же самых или более слабых моделях. Сразу оговорюсь: это не контролируемое сравнение, там другие задачи, другие условия и свой способ считать сбой. Числа стоят рядом как порядок величины.

Но сам порядок величины объясняется просто. В свободном агентном цикле модель на каждом шаге решает, что делать дальше: какой инструмент вызвать, закончена ли задача, что проверить. Каждое такое решение это точка, где слабая модель может ошибиться, и ошибки накапливаются: на пяти шагах с надёжностью 90% каждый до конца доходит 59% задач.

В нашем конвейере модель этих решений не принимает. Структура документа, порядок шагов, что считать готовым, как валидировать результат: всё зашито в конвейер. Модели остаётся только когнитивная часть: понять задачу и написать содержимое. Ограничиваем свободу действий, сохраняем свободу мышления.

Забег с личными финансами это хорошо иллюстрирует. У GigaChat три ошибочных запроса из четырёх, и задача всё равно дошла до готового файла за 28 секунд. В свободном агенте три ошибки подряд означали бы упавшую задачу или бесконечный цикл. Здесь они означали ретрай внутри одного шага, о котором пользователь узнал бы только из лога.

Как устроен забег

форма запуска забега

форма запуска забега

Выбираете тип задачи (документ Word, таблица Excel, лендинг, презентация), описываете задачу, при необходимости прикрепляете файлы, выбираете две модели из списка. Сейчас в списке модели из Yandex Cloud, SberCloud Evolution (GigaChat 2 Max, GLM 4.7) и прямые API DeepSeek.

Обе генерации стартуют одновременно и идут через один конвейер. На странице забега видно каждый этап с временем, число запросов к модели, число ошибочных запросов, лог запросов(не полный) и в конце два готовых файла рядом, которые можно открыть.

Идущие забеги можно смотреть вживую без регистрации. Для запуска своего нужен вход. Забег можно скрыть из общей таблицы, если задача с чувствительными данными.

Что в этом бенчмарке плохо

Чтобы меня не разобрали в комментариях, разберу сам.

  1. Победитель забега определяется по времени, а не по качеству. Забег с личными финансами это ровно тот случай: GigaChat выиграл 28 секунд против 41, а файл у Алисы содержательно богаче. Об этом надо помнить каждый раз, глядя на кубок в таблице забегов.

  2. Нет автоматической оценки качества результата. В лидерборде считается «дошло до файла или нет» и время. Файл может быть формально корректным и при этом пустым по содержанию, как одностраничное КП у GigaChat. Автооценка качества документа это отдельная нетривиальная задача, пока её нет.

  3. Выборки неравномерные. Распределение задач по моделям определяется цепочкой фолбэков и выбором пользователей, а не рандомизацией. Поэтому у Alice 331 задача, а у DeepSeek напрямую 18.

  4. Задачи разной сложности. На странице есть фильтр Light/Hard, но внутри одной группы задачи всё равно разные. Договор на две страницы и смета на 40 строк с формулами это разные задачи, и мы их усредняем.

  5. Один забег это один прогон. Все четыре примера выше сделаны по одному разу. LLM недетерминированы, повторный прогон той же задачи даст другие цифры и, возможно, другого победителя. Относитесь к ним как к иллюстрациям, а не как к измерению.

  6. Сравнение с индустриальными 12–37% некорректно по построению. Уже сказал выше, повторю, чтобы не было иллюзий.

Что дальше: хотим добавить автоматическую оценку качества через независимую модель-судью, выровнять выборки принудительными прогонами одного набора задач по всем моделям и добавить фильтр по типу задачи в лидерборд.

Зачем это выкладывать

Главная причина: заказчикам, которым по регламенту нельзя работать с зарубежными API (госсектор, банки, закрытый контур), до сих пор нечего было предъявить, кроме слайдов вендора. Теперь есть цифры, которые можно проверить, запустив свой забег на своей задаче.

Вторая причина: мне самому было интересно, где лежит граница. Оказалось, что для массовых офисных задач она лежит гораздо ниже, чем принято считать, если правильно спроектировать конвейер вокруг модели. Смета с разделами за 19 секунд на модели, которую принято называть слабой, это не то, чего я ожидал в апреле, когда мы на неё переходили.

Если найдёте задачу, на которой российские модели ломаются, запустите забег и скиньте ссылку в комментарии. Мне это правда интересно.

ссылка на оригинал статьи https://habr.com/ru/articles/1080744/