Июль у Claude: от умного чата к сотруднику, которому показал один раз

от автора

За июль Anthropic выкатила столько апдейтов, что легко утонуть в списке и не заметить главного. А главное простое: почти всё, что вышло за месяц, тянет Claude в одну сторону. От модели, которой ты объясняешь задачу словами каждый раз, к агенту, которому ты один раз показал, как надо, и дальше он делает сам. Разберу, что из июльского реально меняет работу инженера, а что маркетинговый шум, и посчитаю деньги там, где это уместно.

Record a Skill: показал, как стажёру, дальше он сам

Самая недооценённая фича месяца вышла 21 июля и называется Record a Skill. Механика такая: ты включаешь запись экрана в десктопном приложении, выполняешь задачу руками и вслух комментируешь, что делаешь и почему. «Сначала проверяем поле branch, потом назначаем». «Если сумма больше порога, эскалируем, а не подтверждаем». Claude смотрит на клики, нажатия клавиш и твою озвучку одновременно и собирает из этого навык, который потом запускает сам.

По сути это обучение показом вместо обучения текстом. Раньше, чтобы Claude стабильно повторял твой рабочий процесс, ты писал длинную инструкцию, прикладывал документацию и всё равно ловил ошибки на краях, которые забыл описать. Теперь ты просто делаешь работу один раз под запись, как показал бы новому сотруднику в первый день, и проговариваешь исключения по ходу.

Факты, чтобы не приукрашивать. Доступно на Pro, Max и Team, на бесплатном тарифе нет. Только десктоп, Windows и macOS, в вебе и на мобильном пока нет. Живёт в меню «плюс» внутри Cowork. Anthropic на момент запуска не опубликовала подробной техстраницы, так что как именно устроен внутренний формат навыка и как его потом редактировать, официально не расписано. Рекомендованный порядок такой: записал, проговорил правила и исключения, дал Claude собрать навык, а потом обязательно прогнал на свежих данных, прежде чем пускать в дело.

Вот это последнее «прогони на свежих данных» я бы выделил жирным. Обучение по одной демонстрации отлично ловит счастливый путь и легко пропускает то, что ты в тот раз просто не показал. Навык из одной записи это заготовка, а не готовый сотрудник. Но как способ снять с себя двадцатую однотипную задачу в неделю это заметно быстрее, чем писать ту же инструкцию словами.

Регулятор усилий: впервые цена ответа стала ручкой

24 июля вышел Opus 5. Из всего анонса важнее всего для тех, кто платит за токены, одна вещь: регулятор усилий. Теперь можно сказать модели, сколько думать над задачей, в трёх положениях low, medium, high, и от этого зависит объём токенов рассуждения, а значит и счёт.

Цифры. Opus 5 стоит столько же, сколько Opus 4.8: 5 долларов за миллион входных токенов и 25 за миллион выходных. Контекст до 1 миллиона токенов, максимальный вывод 128 тысяч. Есть режим в 2,5 раза быстрее. Регулятор режет именно рассуждения, а они считаются как выходные токены, то есть по самой дорогой ставке.

Соблазн после появления такой ручки один: поставить low на всё и радоваться счёту. Это ошибка, но не потому, что low «тупее». Дело в том, что цена ошибки у разных задач разная, а регулятор её не знает, знаешь только ты. Я для себя развожу задачи по одному признаку: сколько стоит незамеченная ошибка.

Дешёвая ошибка, которую видишь сразу: переформулировать абзац, вытащить поля в JSON, черновик коммит-месседжа, классификация тикета. Здесь low это правильный дефолт, а переплата за high чистый слив бюджета.

Дорогая, но обратимая: рефакторинг функции, генерация SQL, разбор логов. База medium, поднимаю до high точечно, когда задача пахнет неоднозначностью.

Ошибка, которую замечают в проде через три дня: необратимые миграции, финансовая арифметика, всё, что уходит пользователю без ревью, всё автономное, чей вывод никто не читает глазами. Здесь регулятор вниз крутить нельзя, и часто это сигнал, что нужна не экономия на уровне, а более тяжёлая модель и человек в цикле.

Смысл не в таблице, а в смене вопроса. Не «насколько это трудно для модели», а «во сколько мне обойдётся, если она ошибётся и я не замечу».

Немного арифметики

Публичных замеров качества по уровням усилий Anthropic пока не дала, врать не буду, их нет. А стоимость посчитать можно. Пример на выдуманном, но реалистичном объёме, дальше подставишь свои числа.

Пайплайн обрабатывает в день 2 миллиона входных токенов и генерирует 0,5 миллиона выходных. Это 2 × 5 + 0,5 × 25 = 22,5 доллара в день без учёта токенов рассуждения. Именно эти токены регулятор и режет. Выход в пять раз дороже входа, а размышления считаются как выход, поэтому low бьёт по самой дорогой части счёта. Вывод простой: смотреть надо не на входные токены, они дешёвые, а на то, сколько модель нарассуждала. Если на задаче класса «дешёвая ошибка» модель выдаёт три абзаца внутренних размышлений перед однострочным ответом, ты платишь премию за то, что тебе не нужно. Это первое место, где low окупается мгновенно.

Ловушки, на которых сэкономишь и потеряешь

В июле же добавили переключение модели и инструментов посреди задачи с сохранением кэша промпта. Выглядит как чистый выигрыш: тяжёлую часть сделал на дорогой модели, добивку на дешёвой. Ловушка в том, что контекст диалога при каждом обращении переотправляется как вход. На коротких задачах ерунда, на длинных автономных прогонах переключение туда-сюда может съесть экономию. Считать надо не цену следующего ответа, а цену ответа плюс переотправку накопленного контекста.

Вторая ловушка тише и опаснее. Теперь при флагнутом запросе API автоматически падает на другую модель на стороне сервера, вместо того чтобы вернуть ошибку. Для UX приятнее, для надёжности хуже: раньше отказ был явным событием, которое ты ловил, теперь он может маскироваться под обычный ответ от другой модели. Если тебе важна воспроизводимость или ты меряешь качество по модели, логируй, какая модель реально ответила. Не полагайся на то, что раз запросил Opus 5, то и ответил Opus 5.

Остальное июльское, коротко и по делу

Голосовой режим (23 июля) дорос до Opus и Sonnet, научился переключать модель посреди разговора и дёргать реальные действия в Gmail, Slack и других сервисах, плюс 11 языков. Это не игрушка «поговори с ботом», а голосовой интерфейс к агенту, который что-то делает.

Поддержка новой спеки MCP (28 июля) выглядит скучно, но это фундамент под всё вышеописанное: stateless-ядро под serverless, MCP Apps с интерактивным UI прямо в ответе, корпоративная авторизация через OAuth и OIDC, дашборды наблюдаемости за коннекторами и MCP-туннели для доступа в приватную сеть. Если Record a Skill это «покажи агенту, что делать», то MCP-обновление это «дай агенту безопасно дотянуться до твоих систем».

Опубликованные артефакты теперь могут ходить в живые MCP-коннекторы по кредам смотрящего. Управляемые агенты получили ту же настройку уровня усилий и вебхуки на события памяти и окружения. И отдельно для тех, кто ещё пользуется старым Workbench: доступ к нему и к экспериментальным API генерации промптов выключают 17 августа, данные успейте выгрузить.

Что из этого я бы взял в работу сейчас

Три вещи. Record a Skill на всё, что делаю руками чаще раза в неделю, но с обязательным прогоном на свежих данных, потому что одна демонстрация ловит счастливый путь и пропускает края. Регулятор усилий на low по умолчанию для класса дешёвых ошибок и подъём по явному признаку неоднозначности, а не по ощущению сложности. И поле в логах «какая модель реально ответила», потому что тихий фолбэк доверия не внушает.

Общий сюжет июля, если снять маркетинг, такой: Anthropic перестаёт продавать «умную модель» и начинает собирать «сотрудника, которого показал один раз». Record a Skill это как учить, регулятор усилий это сколько платить за его работу, MCP и голос это чем ему дать дотянуться до дела. По отдельности каждый апдейт можно проспать. Вместе они меняют не то, насколько Claude умный, а то, сколько ручной возни вокруг него остаётся у тебя.

Чего не хватает и что было бы ценнее всего в комментариях: реальные прогоны одинаковых промптов на разных уровнях усилий с цифрами по токенам и качеству. Если у кого-то есть, скидывайте, публичных бенчмарков по уровням пока нет.


Источники: анонс Opus 5 и заметки о ценах (Axios, Fortune); Record a Skill (Dataconomy); сводка июльских релизов (Releasebot).

Автор ведёт AGINE Academy, практический курс по искусственному интелекту на Claude (независимый продукт компании AGINE AI, с Anthropic не связан). Разборы пишу из рабочих задач, не из пресс-релизов.

ссылка на оригинал статьи https://habr.com/ru/articles/1064878/