Первый раз я всерьёз задумалась о токенах не тогда, когда увидела цену модели. А когда попросила нейросеть «быстро посмотреть документ и сделать выводы» — и внезапно потратила больше, чем на несколько обычных запросов подряд.
Проблема была не в том, что модель дорогая. Проблема была в том, что в чат был загружен тяжёлый файл, висела длинная история переписки, а промпт звучал как «проанализируй всё подробно». То есть я сама попросила модель прочитать лишнее, подумать широко и ответить длинно.
Токены — это не абстрактная внутренняя валюта. Это то, за что вы реально платите при работе с ChatGPT, Claude, Gemini, DeepSeek и другими моделями. В этом гайде разберём, как считается расход AI-токенов, где они незаметно утекают и как сократить расходы без заметной потери качества. А в BotHub можно сразу сравнить расход разных моделей в одном окне.
Как считаются токены
Если совсем просто: токен — это кусочек текста. Иногда это слово, иногда часть слова, иногда знак препинания. Например, фраза «нейросеть пишет текст» не равна трём токенам: конкретное число зависит от токенизатора модели.
Но для расходов важнее не точная математика, а формула:
Расход = системные инструкции + история чата + файлы + ваш промпт + ответ модели
То есть оплачивается не только то, что вы написали в последнем сообщении. Модель каждый раз получает контекст: предыдущие реплики, загруженные документы, настройки, иногда — скрытые инструкции сервиса.
Поэтому короткий вопрос в длинном чате может стоить дороже, чем большой промпт в новом диалоге.
Где токены утекают чаще всего
1. Слишком большой контекст
Пример: загрузить отчёт на 80 страниц и потом десять раз спрашивать модель про мелкие детали. Каждый запрос снова тянет за собой контекст.
Если документ нужен один раз — попросите модель сначала сделать сжатую выжимку, а дальше работайте уже с ней.
Плохой вариант:
Проанализируй весь документ и предложи идеи.
Лучше:
Выдели из документа только факты про выручку, расходы и риски. Сожми до 20 пунктов. Дальше я буду работать только с этой выжимкой.
2. Длинные промпты без структуры
Парадокс: хороший промпт не обязан быть огромным. Он должен быть точным.
Если вы пишете модели простыню из контекста, пожеланий, ограничений и примеров, но не задаёте формат ответа, она часто отвечает так же широко. А значит — тратит больше выходных токенов.
Рабочая формула:
Роль → задача → входные данные → ограничения → формат ответа
Например:
Ты редактор. Сократи текст до 1200 знаков. Сохрани факты, убери повторы, не добавляй новых данных. Ответ дай в виде готового текста без комментариев.
3. Неправильный выбор модели
Не каждая задача требует флагмана. Если вы просите переписать письмо, классифицировать отзывы или сделать черновую структуру статьи, дорогая модель может быть избыточной.
Условно:
|
Задача |
Что выбрать |
|
Черновик, рерайт, классификация |
DeepSeek или mini-модели |
|
Структура, тексты на потоке |
Claude Sonnet |
|
Сложная логика, стратегия, финальный ответ |
Claude Opus или GPT |
|
Скриншоты, графики, визуальные исходники |
Gemini |
Самый экономный сценарий: сначала прогнать задачу через более дешёвую модель, а флагман подключать только на финальной проверке.
4. Слишком длинный ответ
Выходные токены часто дороже входных. Поэтому фраза «распиши максимально подробно» — почти всегда дороже, чем кажется.
Если нужно решение, ограничивайте объём:
-
«ответ до 10 пунктов»;
-
«не больше 1500 знаков»;
-
«без вступления и вывода»;
-
«только таблица»;
-
«покажи diff, не переписывай весь код».
Для генерации текста это особенно заметно: модель может легко написать 10 000 знаков там, где вам нужны 1500.
Чем считать токены
Есть несколько вариантов.
Для разработки можно использовать токенизаторы и API-инструменты: OpenAI tokenizer/tiktoken, счётчики Anthropic, Gemini countTokens и аналоги. Они полезны, если вы строите свой сервис на ChatGPT API, Claude API или DeepSeek API и хотите заранее оценивать стоимость запроса.
Для обычной работы удобнее смотреть фактический расход после генерации. В BotHub видно, сколько токенов ушло на запрос и ответ, поэтому можно сравнить: один и тот же промпт в Claude, GPT, Gemini или DeepSeek — и сразу понятно, какая модель даёт лучший баланс цены и качества.
Мини-чеклист перед отправкой запроса
-
Нужен ли модели весь документ или только фрагмент?
-
Можно ли заменить историю чата короткой выжимкой?
-
Задан ли формат ответа?
-
Ограничена ли длина результата?
-
Не используете ли вы дорогую модель для простой задачи?
-
Нужно ли просить полный ответ или достаточно diff/таблицы/списка?
Оптимизация токенов — это не про «пользоваться нейросетями меньше». Это про нормальную маршрутизацию задач: короткий контекст, точный промпт, правильная модель и контроль длины ответа.
Если задача простая — не жгите бюджет на флагмане. Если задача сложная — не экономьте на модели, но заранее сожмите контекст. А чтобы не гадать, куда ушли деньги, смотрите прозрачный расход токенов в BotHub: все популярные нейросети в одном окне, без десяти подписок и ручного подсчёта.
ссылка на оригинал статьи https://habr.com/ru/articles/1066218/