Агент за доллар: как устроена экономика связки Hermes Agent + DeepSeek V4 Flash

от автора

В начале августа по X разошёлся скриншот: панель расходов, сотни миллионов обработанных токенов и счёт чуть больше доллара. Работа велась через открытый Hermes Agent на модели DeepSeek V4 Flash. Скриншот — личный дашборд пользователя, проверить его со стороны нельзя, поэтому дальше речь не о том, правдив ли конкретный счёт, а о том, какая механика делает такой счёт возможным и в какой момент она перестаёт работать.

Скрин пользователя Erick в X

Скрин пользователя Erick в X

TL;DR

  • Hermes Agent — открытый автономный агент от Nous Research под MIT, работает с любым OpenAI-совместимым эндпоинтом.

  • DeepSeek V4 Flash в публичной бете с 31 июля: та же архитектура, что у апрельского превью, заметно подтянутые агентские способности после дообучения.

  • Основную экономию даёт не низкая ставка сама по себе, а автоматическое кэширование префикса: повторяющееся начало запроса считается по ставке в десятки раз ниже обычной.

  • Агентский цикл попадает в эту механику почти идеально, он раз за разом отправляет один и тот же системный промпт и историю шагов, дописывая пару строк в конец.

  • Ломается экономия на мелочах в шапке промпта: метка времени, идентификатор сессии, перетасованный порядок инструментов.

  • Заявленное превосходство младшей модели над старшей, по агентским бенчмаркам вендора; на тяжёлом рассуждении DeepSeek сама рекомендует уходить на V4-Pro.

  • Надбавка за часы пик анонсирована, но на момент публикации не включена, её стоит заложить в план заранее.

Собственно про Hermes Agent

Hermes Agent вышел в феврале, десктопная сборка под macOS, Windows и Linux появилась в июне. Лицензия MIT, репозиторий открыт. Nous Research позиционирует его как автономного агента с замкнутым циклом обучения: закончив задачу, агент оценивает результат, записывает найденный способ в markdown-файл навыка и переиспользует его в следующих сессиях. Память сохраняется между запусками, формат навыков совместим с открытым стандартом agentskills.io.

Практическая часть: терминал, файловые операции, браузер, выполнение кода, генерация изображений, планировщик задач, подключение к MCP-серверам. Запускается локально, в Docker, по SSH, а также на serverless-площадках вроде Daytona и Modal, где простаивающее окружение почти ничего не стоит. Общаться с ним можно из Telegram, Slack, почты и ещё двух десятков каналов.

Заявление про «самообучение» стоит читать буквально и без энтузиазма: агент пишет себе процедурные заметки и подтягивает их в контекст. Веса модели при этом не меняются, никакого дообучения на лету здесь нет.

Почему счёт выходит копеечным

Вся арифметика держится на одном свойстве DeepSeek API — автоматическом кэшировании начала запроса. Если новый вызов повторяет префикс, который модель недавно видела, повторённая часть тарифицируется по отдельной, сильно сниженной ставке. Никаких заголовков и флагов включать не нужно, механика работает сама.

Порядок ставок на V4 Flash, чтобы держать картину в голове одной таблицей:

Что тарифицируется

Ставка за 1 млн токенов

Вход, промах кэша

$0,14

Вход, попадание в кэш

$0,0028

Выход

$0,28

Разрыв между двумя строками входа — пятьдесятикратный. Это единственная цифра из таблицы, которую имеет смысл запомнить: всё остальное — следствие.

Теперь почему именно агенту это выгодно. Агентский цикл устроен так, что каждый следующий вызов отправляет ровно то же, что предыдущий, плюс несколько новых строк: системный промпт, описания инструментов, файлы проекта, историю уже сделанных шагов. Доля неизменной части в общем объёме входа доходит до девяноста с лишним процентов. Стабильная шапка уходит в кэш, реальные деньги остаются только за то, что модель генерирует в ответ.

У чат-бота или разовой обработки документов эта доля кратно ниже, и там та же модель обойдётся заметно дороже на сопоставимом объёме. Дешевизна — свойство сценария, а агентский цикл просто оказался самым удачным его представителем.

Что ломает кэш

Здесь начинается практическая часть, ради которой стоит читать дальше.

Кэш держится на побайтовом совпадении префикса. Любой элемент, который меняется от вызова к вызову и стоит в начале, обнуляет попадание для всего, что идёт после него. Типовые виновники:

  • метка текущего времени или даты в системном промпте;

  • идентификатор сессии, запроса или пользователя, подставленный в шапку;

  • список инструментов, который сериализуется из словаря без фиксированного порядка;

  • динамически подставляемый список файлов рабочей директории;

  • «свежие» фрагменты RAG, вставленные перед основным контекстом, а не после него.

Правило: неизменное — в начало, переменное — в хвост. Проверять эффект удобнее всего по счётчику cache-hit в панели провайдера: если доля попаданий заметно ниже ожидаемой, ищите движущийся элемент в первых килобайтах промпта.

Отдельно про переключение моделей. Кэш привязан к конкретной модели, и гибридная маршрутизация с эскалацией на старшую версию сбрасывает накопленный префикс. Экономически это всё равно оправдано, но закладывать в расчёт «дешёвый вход» для эскалированных вызовов не стоит.

Где заканчиваются заявления вендора

Августовская сборка V4 Flash сохранила архитектуру апрельского превью и получила дополнительное дообучение под агентские задачи. По девяти опубликованным агентским бенчмаркам она обходит превью старшей модели V4-Pro — на Terminal-Bench 2.1 разрыв заметный, на DeepSWE прирост относительно собственного превью многократный.

Оговорки, которые здесь важны:

  • это бенчмарки вендора на агентских сценариях, а не независимая оценка на вашем коде;

  • «обходит старшую модель» относится к превью-версии V4-Pro, полный релиз которой на момент публикации ещё не вышел;

  • на длинном многошаговом рассуждении, олимпиадной математике и тяжёлой отладке DeepSeek сама рекомендует уходить на Pro.

Отсюда вытекает рабочая схема: весь трафик по умолчанию на Flash, эскалация на Pro только по срабатыванию проверки качества. Разница в цене между ними на смешанной нагрузке примерно трёхкратная, так что гибридная маршрутизация обходится дёшево.

Подводные камни, которые лучше поймать заранее

Надбавка за часы пик. DeepSeek анонсировала удвоение ставок в двух дневных окнах. На момент публикации официальный прайс держит единую ставку без временных тиров, но надбавка привязана к полному релизу V4. Пакетную нагрузку, которой не нужна срочность, разумно с самого начала планировать вне этих окон.

удвоение ставок в двух окнах по будням, 01:00–04:00 и 06:00–10:00 UTC.

Лимиты. DeepSeek публикует только ограничение по одновременным запросам, RPM и TPM в документации отсутствуют. Автоматических тиров нет: потолок не растёт ни от объёма трат, ни от возраста аккаунта, поднимается он отдельным обращением в поддержку. При 429 корректная реакция — сократить число запросов в полёте и уйти в экспоненциальный бэкофф, а не расширять параллелизм.

Периметр. Агент с доступом к терминалу и файловой системе работает на вашей машине или вашем сервере. В Hermes Agent есть подтверждение команд, разграничение прав и изоляция в контейнере — включать их стоит на старте. Содержимое проекта при этом уходит на серверы провайдера, и для клиентской работы это отдельный пункт для сверки с договором.

Привязка к провайдеру. Веса V4 Flash выложены открыто, так что запасной вариант с самостоятельным хостингом существует. Считать его дешёвой альтернативой не стоит — модель крупная, но как страховка от изменения прайса он рабочий.

По чему судить, работает ли схема у вас

Короткий чек-лист перед тем, как переносить эту связку на боевую нагрузку:

  1. Доля попаданий в кэш на реальной сессии — если она не выходит на высокие значения, экономики не будет, и виновата почти всегда шапка промпта.

  2. Стабильность порядка сериализации инструментов и контекстных файлов между вызовами.

  3. Доля вызовов, которые пришлось эскалировать на старшую модель, — она определяет реальную среднюю цену задачи.

  4. Поведение при 429 под нагрузкой: очередь и бэкофф вместо расширения параллелизма.

  5. Что именно из рабочего проекта уходит в запросы и допустимо ли это по вашему договору.

Скриншот с копеечным счётом — не характеристика модели, а характеристика аккуратно собранного промпта. Те же объёмы при небрежной шапке дадут счёт другого порядка, и это единственный вывод, который переносится на любую другую связку.


А у кого на длинных агентских сессиях получалось удерживать высокую долю попаданий в кэш — и что чаще всего её сбивало?

Ссылки по теме

Источники: DeepSeek API Pricing, Nous Portal

ссылка на оригинал статьи https://habr.com/ru/articles/1066896/