JetBrains протестировали скилл Ponytail: объём кода сократился на 15%, а расходы на 10%

от автора

JetBrains опубликовали результаты тестирования Ponytail — скилла для coding-агентов, который должен бороться с оверинжинирингом. Он предлагает агенту сначала поискать самое простое решение и только после этого писать новый код.

Авторы Ponytail заявляют о сокращении объёма генерируемого кода на 54%, количества токенов — на 22%, расходов — на 20%, а времени выполнения задач — на 27%. В независимом тесте JetBrains показатели оказались скромнее, но скилл действительно сработал.

Как работает Ponytail

Перед реализацией задачи Ponytail заставляет агента пройти своеобразную «лестницу минимализма»:

  • нужна ли эта реализация вообще;

  • нет ли подходящего решения уже в проекте;

  • можно ли использовать стандартную библиотеку;

  • поддерживает ли это сама платформа;

  • есть ли нужная возможность в уже установленной зависимости;

  • можно ли решить задачу одной строкой;

  • какой минимальный объём нового кода действительно необходим.

При этом правила скилла не должны сокращать валидацию, обработку ошибок, безопасность и доступность интерфейсов.

Например, вместо установки отдельной библиотеки и создания компонента для выбора даты агент может использовать стандартный HTML-элемент <input type="date">, если его возможностей достаточно для задачи.

Как проходило тестирование

JetBrains сравнили обычный Claude Code и Claude Code с Ponytail на 80 парных задачах из SkillsBench. В обоих случаях использовалась модель Claude Sonnet 5.

Правила Ponytail принудительно добавлялись в контекст агента. Это важная деталь: когда исследователи просто установили SKILL.md и оставили решение об активации модели, Claude Code не воспользовался скиллом ни в одной из десяти тестовых сессий.

Полноценная версия Ponytail решает эту проблему с помощью плагина и хука SessionStart, который автоматически добавляет инструкции в начало каждой сессии.

Обещания и результаты

В тестах JetBrains Ponytail сократил объём написанного агентом кода примерно на 15% вместо заявленных 54%.

Общее потребление токенов снизилось примерно на 8%, стоимость выполнения задач — на 10%, а время работы — примерно на 11%. Сильнее всего сократился именно текст, который генерирует модель.

Таким образом, все показатели изменились в заявленную сторону, но фактическая экономия составила примерно от четверти до половины от обещанной.

Заявленные показатели Ponytail и результаты тестирования JetBrains.

Заявленные показатели Ponytail и результаты тестирования JetBrains.

Результат зависит от размера задачи

Наибольший эффект Ponytail показал в задачах, где у агента было пространство для оверинжиниринга.

В крупных задачах объём кода сокращался примерно на 31%. В реализациях среднего размера — примерно на 21%, в небольших — на 12%. Если обычный агент и без скилла писал минимальное количество кода, Ponytail почти ничего не менял.

JetBrains отмечает, что заявленные разработчиками Ponytail 54% были получены на 12 специально выбранных задачах с характерными ловушками для coding-агентов. В таких сценариях модель могла устанавливать лишние зависимости, создавать дополнительные абстракции или писать собственную реализацию вместо использования возможностей платформы.

Чем больше кода писал обычный агент, тем заметнее был эффект Ponytail

Чем больше кода писал обычный агент, тем заметнее был эффект Ponytail

Качество выполнения задач не изменилось

Из 80 парных задач 65 получили одинаковую оценку с Ponytail и без него. В шести случаях версия со скиллом показала лучший результат, в девяти — худший. JetBrains не обнаружила заметного влияния на итоговое качество выполнения задач.

При этом тесты SkillsBench проверяли, справился ли агент с заданием, но не проводили отдельный аудит безопасности, валидации или доступности. Поэтому результаты не подтверждают заявление разработчиков Ponytail о полном сохранении защитных механизмов.

В большинстве задач оценка с Ponytail и без него совпала

В большинстве задач оценка с Ponytail и без него совпала

Вывод

Ponytail не обеспечил заявленного сокращения кода на 54%, но всё же показал измеримый результат: примерно на 15% меньше кода и на 10% ниже расходы без заметного ухудшения качества.

Польза скилла зависит от поведения самого агента. Если модель уже предлагает компактные решения, разница будет небольшой. Если она склонна создавать лишние абстракции, подключать библиотеки и превращать небольшие задачи в отдельные подсистемы, эффект Ponytail становится заметнее.

Это третье исследование JetBrains в серии тестов инструментов для экономии ресурсов coding-агентов. Ранее компания проверила Caveman, сокращающий текстовые ответы, и RTK, сжимающий вывод командной строки. Ponytail стал первым инструментом серии, который показал убедительное снижение расходов на полном наборе задач.

Источник: JetBrains AI Blog.

Русскоязычное сообщество про AI в разработке

Друзья! Эту новость подготовила команда ТГК «AI for Devs» — канала, где мы рассказываем про AI-агентов, плагины для IDE, делимся практическими кейсами и свежими новостями из мира ИИ. Подписывайтесь, чтобы быть в курсе и ничего не упустить!

ссылка на оригинал статьи https://habr.com/ru/articles/1064338/