Лучшие модели для разработки с ИИ на 1С (бенчмарк v2)

от автора

Claude Opus 5, Claude Fable 5, GPT 5.6 Sol, Kimi K3, Claude Opus 4.8, Grok 4.5, Composer 2.5, GPT 5.5, DeepSeek v4, GLM 5.2, Qwen 3.8 Max, Claude Sonnet 5, Mimi 2.5, MiniMax M2.7.

Для тех, кому лень читать до конца, текущий итог:

Сам бенчмарк регулярно обновляется, добавляются новые модели и оценки.

Ссылка на актуальную версию https://vibecoding1c.ru/bench

Вся информация о задачах в бенчмарке публичная и при необходимости можно перепроверить. Артефакты для каждой задачи включены.

Для удобства тексты задач и «правильные ответы» размещены на github: https://github.com/comol/1CLLMBenchTasks

В мае 2025-го года я выпустил первый бенчмарк на эту тему, потом регулярно его обновляя, пока не появился портал. Предыдущая история бенчмарков:

Часть 1

Часть 2

Часть 3

Часть 4

Часть 5

Часть 6

Почему я так внимательно подошел к этому вопросу? Потому что разработка начинается именно с модели. Конечно же harness, MCP, Skills, Rules, SDD — всё имеет важность и ценность, но начинается всё именно с правильного выбора модели.

Притом если в начале 2025-го года одним из основных «тестов» бенчмарка было сможет ли модель «написать сортировку пузырьком» на 1С, то теперь мы начинаем бенчмарк с хитрых запросов вроде генерации последовательных чисел и заканчиваем разработкой подсистем с обновлением БД и тестированием. Как минимум бенчмарк четко показывает что многие современные модели уже даже без использования специализированных скиллов и MCP вполне в состоянии собрать, к примеру, внешнюю обработку или отчет на 1С. А уже при наличии полной обвязки успешно выполняют практически любые задачи.

Утверждение может показаться слишком смелым, но даже разработчик уровня senior едва ли решит половину задач данного бенчмарка, по моему экспертному мнению. Средняя модель справляется со всеми задачами данного бенчмарка за 3-4 часа.

Особенности бенчмарка:

  • Задачи разделены на категории (Алгоритмы, Архитектура, Механизмы платформы, производительность, работа с метаданными, разработка форм)

  • В бенчмарка включены потраченные токены (input + output), при этом исключен кэш (input cache + output cache)

  • Модели тестировались средствами своих «вендорских» сред (claude code — для claude, codex — для GPT, kimi code для kimi, Cursor для Grok и Composer и т.п.). У сред конечно разный systemprompt, но есть предположение что вендор модели лучше всего понимает какой systemprompt для неё лучше всего

  • Вариант тестирования «С MCP» подразумевает использование набора MCP серверов для разработки с ИИ на 1С отсюда и набора скилов и правил для разработки с ИИ на 1С отсюда. Вариант включен не столько «в рекламных целях» сколько для отображения реальных результатов, потому что без дополнительных MCP и правил разработка с ИИ в 1С редко ведётся — всё таки модели «знают» её хуже и есть некоторые «особенности».

  • Бенчмарк выполнял Hermes с моделью GPT 5.6 Sol. Иногда ошибался в оценках — часть корректировалось. Конечно есть доля сбъективизма к примеру, в оценке удобства сгенерированных форм.

  • Во всех моделях бенчмарка использовался максимально доступный reasoning effort

Для каждой модели доступны все оценки, конечно с кодом, комментарием, сгенерированными артефактами. Доступен отбор задач по категории и переключатель MCP\без MCP.

Как сам бенчмарк так и более детально как его делал автономный агент в течении 5 суток запускавший и мониторивший по ACP остальные агенты я также рассказал в видео

Нужно отдельно отметить что для «новых» моделей есть нюансы, о которых стоит говорить: GPT 5.6 Sol, Kimi K3, Qwen 3.8, Claude Fable 5 — Reasoning эффект и так «достаточно высокий». Модель будет пытаться выполнять задачу «до победного», во множество итераций, тратить множество токенов и соответственно времени. Временной фактор в бенчмарке ПОКА не учитывался — может в следующих версиях. Но время несколько коррелирует с числом потраченных токенов очевидно, хотя для отдельных моделей, к примеру, Kimi K3 время при том же количестве токенов будет существенно выше.

Что получилось по моделям:

  • Opus 5 — безусловный лидер, модель очень хороша, лучшее что есть для кодинга на текущий момент времени (хотя лучше использовать скорее для архитектуры). Но со следованием инструкциям есть определенные проблемы. Поэтому в варианте «C MCP» модель всё таки проигрывает GPT 5.6 Sol, всё таки по традиции модели Claude могут игнорировать часть инструкций

  • Opus 4.8 — вцелом просто можно заменять на Opus 5

  • Fable 5 — не имеет смысла после выхода Opus 5

  • Kimi K3 — Очень хорошая модель — на уровне топовых платных и даже выше. Пока есть проблемы со скоростью работы

  • GPT 5.6 Sol — Лучшая модель если работать с MCP и инструкциями. Со следованием инструкциям меньше проблем чем у Claude

  • Grok 4.5 — Хорошая модель, но лучше использовать с MCP и правилами

  • Composer 2.5 — Очень похожа на Grok

  • GPT 5.5 — Смысла использовать особо не имеет

  • DeepSeek v4, GLM 5.2 — выбор только если по цене, только для разработки и только с MCP и правилами

  • Модели Qwen 3.8, Sonnet 5, Mimo 2.5, Minimax M2.7 я бы пока не рекомендовал для разработки на 1С.

Планы на будущее:

  • Надо бы время включить для задач

  • Полную стоимость выполнения задач

  • Отдельно кэш и потраченные токены вместе со стоимостью

  • Добавить задачи на доработку существующего функционала. Текущий бенч не показывает к сожалению экономию токенов на поиске при доработке функционала. Не получилось у меня рекламу MCP сделать из этого бенча

Некоторые выводы:

  • Claude Opus по прежнему лучшая модель для разработки — с выходом Opus 5. Но внимание на следование инструкциям. Если у вас всё хорошо с правилами и MCP то имеет смысл выбрать GPT — с MCP у неё расход токенов сильно меньше в т.ч. чем у claude. Соответственно в итоге выйдет дешевле.

  • Kimi K3 — многообещающая модель, но пока рано в оснвном из за скорости работы

  • Намного более простые модели, которые точно следуют инструкциям при разработке дают сопоставимые результаты с топовыми моделями при цене которая сильно ниже

  • DeepSeek и GLM можно по сути пока убрать из стека.

Что я выбрал для себя:

  • Cursor содержит все нужные мне инструменты для работы. По лимитам буду проверять.

  • Claude Opus (внутри Cursor) — Для не 1С задач + планирование архитектуры и чего то уж очень уникального, может оркестрации других агентов

  • Grok\Composer (ещё буду проверять что из них) как «рабочие лошадки» для большинства задач

  • GPT 5.6 отдельной подпиской -для задач review + я его для своих автономных агентов использую. Может как Backup в разработке, если будут вопросы к Opus.

На этом у меня всё. Не пишите код руками. Ну и да, канал у меня тоже есть. Про ИИ в разработке и не только, в т.ч. обновления этого бенчмарка будут в т.ч. там.

ссылка на оригинал статьи https://habr.com/ru/articles/1063244/