
В предыдущей статье я описал трёхуровневый Governance-стек, который делает автономных агентов безопасными, и закончил вопросом: сколько это стоит? 80 000 токенов политик, навыков и ревью-промптов загружаются при каждом вызове агента. Это не бесплатно. Так можно ли позволить себе полноценный Governance, или экономика толкает команды к минимально жизнеспособному CLAUDE.md?
Эта статья отвечает на вопрос реальными данными. Две недели продакшен-разработки. Один разработчик. 30 993 запроса к агентам. 8,8 миллиарда токенов. Ни одной строчки кода, написанной вручную. Ответ нас удивил. А причина, по которой всё сложилось именно так — одна архитектурная ставка одной компании — значит больше, чем миллиарды долларов, вложенные в железо.
Часть 1. Налог на контекст
Governance потребляет контекст. Каждый документ политики, каждый ревью-промпт, каждая зафиксированная спецификация, каждый навык — всё это попадает в контекстное окно. А контекст — главный драйвер стоимости инференса. В этом и есть экономический парадокс Governance: чем безопаснее агентный код, тем дороже он обходится.
Сколько стоит Governance
Типичный вызов агента в нашем проекте загружает: ~35 000 токенов политик (CLAUDE.md плюс 12 доменных документов), ~20 000 токенов описаний навыков, ~7 000 токенов промптов специализированных агентов, ещё столько же — ревью-промптов, и ~3 000 токенов инструкций рабочего процесса. Текущий контекст задачи — спецификация, список задач, файлы кода — добавляет ещё 20 000–40 000. Итого: от 70 до 90 тысяч токенов накладных расходов на каждый вызов.
Цены на июнь 2026 года:
|
Модель |
SWE‑bench |
Cache Hit |
Cache Miss |
Output |
|---|---|---|---|---|
|
Opus 4.8 |
88.6% |
$0.50 |
$5.00 |
$25.00 |
|
Sonnet 4.6 |
79.6% |
$0.30 |
$3.00 |
$15.00 |
|
Haiku 4.5 |
73.3% |
$0.10 |
$1.00 |
$5.00 |
|
DeepSeek V4 Pro |
80.6% |
$0.0036 |
$0.435 |
$0.87 |
|
DeepSeek V4 Flash |
79.0% |
$0.0028 |
$0.140 |
$0.28 |
С ценами Anthropic на кэш-чтение (скидка 90% от базовой), Governance-оверхед для средней фичи — примерно миллион токенов — стоит $0,84 при оптимистичных 80% попадания в кэш. На 50 фич в год — уже заметно. Семь фаз с независимыми ревьюерами — реальные расходы. При ценах DeepSeek V4 Flash тот же оверхед — меньше $0,004 за фичу. Одно дело — когда Governance нужно закладывать в бюджет и доказывать его окупаемость, и совсем другое — когда он стоит копейки и вопрос окупаемости даже не встаёт.
Но реальная проблема не в стоимости Governance на уровне одной фичи, а в том, что происходит на масштабе организации, когда затраты никто не контролирует.
Что бывает без контроля
Три инцидента 2026 года показывают цену отсутствия Governance:
Uber — лимит $1 500 на инженера после того, как годовой бюджет кончился за 4 месяца. Uber выдал Claude Code примерно 5 000 инженеров в декабре 2025. К апрелю 2026 годовой бюджет на AI-кодинг был исчерпан. Затраты на инженера достигали $500–2 000 в месяц у активных пользователей, а CTO лично сжёг $1 200 за одну двухчасовую сессию. Около 70% коммитов создавались AI-инструментами; примерно 11% обновлений бэкенда в проде были написаны агентами с нулевым человеческим ревью. COO Эндрю Макдональд публично усомнился в ROI: «Очень трудно провести линию между [25% AI-коммитов] и “мы производим на 25% больше полезных фич для пользователей”». Ответ Uber: жёсткий лимит $1 500 в месяц на инструмент, обязательные дашборды и отмена доски лидеров по использованию AI.
Анонимное предприятие — $500M за один месяц. Неназванная компания предоставила тысячам сотрудников неограниченный доступ к AI-инструментам без лимитов, без дашбордов, без алертов. Корневая причина: неограниченные циклы задач — агенты плодили подзадачи без явных условий выхода, и каждая тащила за собой полное контекстное окно.
Microsoft, Amazon, Pinterest — структурное отступление. Microsoft отменила внутренние лицензии Claude Code после того, как затраты достигли $500–2 000 в месяц на инженера. Amazon закрыл доску лидеров «Kirorank» после того, как сотрудники начали накручивать её бессмысленными агентными задачами («токенмакссинг»). Pinterest полностью перешёл на open-source модели (Qwen от Alibaba), достигнув «качества, близкого к frontier-моделям, при снижении затрат на 90%», по словам CTO Мэтта Мадригала. Брайан Чески из Airbnb публично высказался в пользу более дешёвых альтернатив. Внутренняя запись Accenture показала, что сотрудники жгли токены на тривиальную конвертацию PDF в PowerPoint.
Одна и та же история во всех пяти компаниях: Governance вводили не до, а после — когда счёт уже лежал на столе. Ни у кого не было предварительного контроля затрат. Никто не установил бюджеты на инженера до развёртывания. Ни у кого не было автоматических стоп-кранов для runaway-агентов.
Стэнфордская лаборатория цифровой экономики (апрель 2026) обнаружила: задачи агентной разработки потребляют до 1 000× больше токенов, чем простой чат. Разброс стоимости на одной и той же задаче — до 30× между запусками. Модели систематически недооценивают собственное потребление — лучшая корреляция предсказаний составила 0,39 из 1,0. Gartner оценивает типичный множитель в 5–30× для продакшен-нагрузок. Одна только эта вариативность делает неуправляемую агентную разработку непригодной для бюджетирования на уровне организации.
Ирония: Governance, описанный в предыдущей статье, предотвратил бы каждый из этих исходов. Но его не было — потому что при ценах Pro-моделей комплексный Governance выглядит дорогим. Сэкономили на управлении — потеряли на перерасходЧасть 2. 8,8 миллиарда токенов — две недели в окопах
За 14 дней (11–25 июня 2026) один разработчик потребил 8,82 миллиарда токенов в 30 993 запросах — в среднем 284 568 токенов на запрос. Он работал исключительно через агентов под Governance-стеком из предыдущей статьи и не написал ни одной строчки кода вручную. Попадание в кэш: 8,75 млрд токенов (99,38%). Промахи: 54,6 млн (0,62%). Вывод модели: 15,1 млн. Единственный пропущенный день (12 июня) — выходной по графику 996.
Наши 99,38% попадания в кэш — это специфическая ситуация: один разработчик, одна кодовая база, один и тот же Governance-префикс, и график 996, при котором кэш не успевает остыть между длинными сессиями. Команда из пяти человек с обычным графиком, ротацией контекста и прерывистыми сессиями увидит более низкие показатели. Наши цифры реальны, но у вас они могут быть другими.
Дневная динамика
Дневной ритм повторяет фазы агентной разработки. Лёгкие дни (700K–300M токенов) — это планирование, дизайн и ревью, где доминирует Pro-модель. Тяжёлые дни (1B–1,4B токенов) — фазы реализации, где Fast-модели и Pro-ревьюеры работают в объёме по зафиксированным спецификациям. Пиковый день, 23 июня — 1,43 миллиарда токенов в 4 889 запросах — большая имплементация с параллельной оркестрацией подагентов: почти миллион токенов в минуту на протяжении суток.

Каким мог бы быhть счёт
При реальном уровне кэш-хита Claude Code в 92% (данные Requesty, агрегированные по тысячам продакшен-пользователей):
|
Провайдер |
Cache Hit(92%) |
Cache Miss(8%) |
Output |
14 дней |
В месяц |
|---|---|---|---|---|---|
|
Opus 4.8 |
$4,050 |
$3,522 |
$378 |
$7,950 |
$17,036 |
|
Sonnet 4.6 |
$2,430 |
$2,113 |
$227 |
$4,770 |
$10,222 |
|
Haiku 4.5 |
$810 |
$704 |
$76 |
$1,590 |
$3,407 |
|
DeepSeek (факт) |
$31.68 |
$23.76 |
$10.73 |
$66.17 |
$141.80 |
При ценах Sonnet с реалистичным хитом один разработчик в режиме интенсивной Governance-разработки стоит больше 10 000 в месяц только на инференсе. Даже Haiku, самая дешёвая модель Anthropic, выходит в $3 407 в месяц. Разрыв создаёт цена кэш-чтения: $0,30/млн против $0,0036/млн — разница в 83 раза. Она же даёт 72-кратный разрыв в средневзвешенной стоимости (0,54/млн против $0,0075/млн), и это не скидка и не акция, а прямое следствие архитектуры: MLA сжимает KV-кэш на 93%, и никаким дисконтом такое не повторить.
$10 222 в месяц на Sonnet — это жизнеспособно для хорошо финансируемых команд: 37% от зарплаты старшего инженера за кратный рост продуктивности — оправданный компромисс. Но это строка в бюджете. Её нужно обосновывать. Она создаёт давление: урезать политики, пропускать раунды ревью, сокращать стек до минимально жизнеспособного CLAUDE.md, когда бюджет поджимает.
И это лучший случай для Anthropic. Наш Governance-префикс в 80 000 токенов — это небольшой стартап: один язык, одна кодовая база, скромные требования. Доля Governance в счёте Sonnet — примерно $2 740 в месяц. Предприятие с сотнями сервисов, несколькими языками и сертификациями вроде SOC2 или HIPAA понесёт Governance-префикс в 3–5 раз больше. Затраты на Governance — и разрыв — будут масштабироваться вместе с ним. 72-кратная разница умножается на вес политик. Чем больше Governance-стек, тем важнее архитектура.
Часть 3. Структурное преимущество DeepSeek в экономике кэширования
У парадокса Governance есть структурная причина: при ценах Pro-моделей 80 000 токенов Governance-префикса стоят $0,04–0,13 за вызов агента (при кэш-хите от 92% до 50%). На 30 993 вызовах за две недели это $1 300–4 100 только на чтение правил — и больше, если кэш истекает за ночь или между сессиями. Это подталкивает к сокращению Governance, а сокращение ухудшает качество кода — и убивает саму цель. DeepSeek ломает этот компромисс — не агрессивным ценообразованием, а перестройкой трансформера так, чтобы доминирующая операция в агентных нагрузках — чтение стабильного контекстного префикса из кэша — становилась практически бесплатной.
Цифры, которые ломают компромисс
DeepSeek — это 1,4% от стоимости Sonnet. $66,17 против $4 770 за те же две недели, тот же код на выходе, тот же кэш-хит 92%. Разница в средневзвешенной стоимости — 72×, порождённая 83-кратной разницей в цене кэш-чтения. Почему так?
Governance-архитектура из предыдущей статьи создаёт почти идеально кэшируемую нагрузку: один и тот же системный промпт на каждом вызове, спецификации и задачи стабильны на протяжении фичи, файлы кода неизменны, пока агент их не поменяет. График 996 держит кэш тёплым между длинными сессиями. V4 Pro стабильно держался выше 99% попаданий каждый день измерений — Governance-префикс стабилен. Единственный день ниже 99% — 11 июня, до насыщения кэша.
Но общий кэш-хит скрывает реальную динамику. При 99,38% попаданий в кэш, промахи генерируют 40,9% от общей стоимости ввода — потому что промах стоит в 120 раз дороже попадания (791,52** — в 14,8 раза больше. Governance-архитектура не просто выигрывает от экономики кэширования — она создаёт тот уровень кэш-хита, при котором эта экономика работает.
К середине 2026 года DeepSeek — единственный провайдер frontier-уровня с таким сочетанием возможностей и экономики кэширования. Anthropic, OpenAI и Google используют механизм внимания (attention) на основе GQA или MHA — ни один не сжимает KV-кэш до такой степени, как MLA. Результат: их кэши живут в GPU HBM с истечением в лучшем случае через час, потому что KV-кэш размером 128K-контекста при 50+ ГБ экономически невозможно хранить на диске; кэши DeepSeek живут днями, потому что в 10 раз меньший кэш помещается на commodity SSD через 3FS. Это не ценовая стратегия, которую конкуренты могут повторить скидкой, — это преимущество hardware-software co-design, требующее перестройки механизма внимания с нуля.
Как DeepSeek делает кэш-чтение почти бесплатным
Каждая модель-трансформер хранит «ключи» и «значения» предыдущих токенов в высокоскоростной памяти GPU (HBM) — это KV-кэш. Именно он является узким местом: объём HBM ограничивает, сколько запросов может обслуживать GPU, а пропускная способность HBM ограничивает скорость генерации токенов. В стандартном multi-head attention KV-кэш на токен — 280–490 КБ. Для 128K-контекста это 35–62 ГБ — примерно весь HBM ускорителя A100.
Multi-Head Latent Attention (MLA). Ключевая инновация DeepSeek, представленная в модели V2 (май 2024). MLA сжимает KV-кэш на 93,3% — с ~400 КБ/токен до ~7 КБ/токен — без потери качества. Статья DeepSeek-V2 показала, что MLA даёт качество, сопоставимое со стандартным multi-head attention, а при тщательной настройке может даже слегка его превосходить — и всё это с экономией памяти в 93%.
Вместо хранения полных векторов ключей и значений для каждой головы внимания MLA хранит низкоранговый латентный вектор (~512 измерений). Ключевой трюк — матричное поглощение: матрицы повышающей проекции, которые восстанавливают полные K и V, умножаются на другие весовые матрицы на этапе загрузки — ноль дополнительных вычислений при инференсе.

Стандартный MHA хранит полные K и V для каждой головы. GQA (LLaMA, Qwen) заставляет головы делить K/V, теряя в качестве. MLA сжимает представление без потери разнообразия голов, а восстановление математически поглощается в другие операции. Статья MHA2MLA (ACL 2025) показала, что любую существующую модель можно адаптировать к MLA с более чем 92% сжатия KV-кэша и падением качества ~0,5% при минимальном дообучении — техника портируема.
Почему одного disaggregation недостаточно. «Просто разделите prefill и decode» — стандартный ответ на стоимость инференса. Разделение улучшает утилизацию, размещая compute-bound prefill и memory-bound decode на разных пулах GPU. Но возникает новое узкое место: трансфер KV-кэша с prefill- на decode-узлы через RDMA. На 400 Гбит/с 128K-контекстный KV-кэш передаётся ~172 мс при стандартном MHA — против ~12 мс при MLA. Исследование China Mobile и Huawei (2025) показало, что этот трансфер лимитирован не пропускной способностью, а RTT: несмежные блоки памяти PagedAttention вызывают «классическую проблему малого окна TCP». Больше полосы не помогает. Исследование ноября 2025 показало, что разделение может даже увеличить энергопотребление. Консенсус: разделение необходимо, но недостаточно без сжатия KV-кэша.
Почему одного квантования тоже недостаточно. TurboQuant от Google (ICLR 2026) — это state of the art: сжимает KV-кэш до 3 бит с нулевой потерей точности, достигая 6-кратного сокращения памяти на любой модели без переобучения. PolarQuant, его первая стадия, преобразует ключевые векторы в полярные координаты, чтобы исключить выбросы при квантовании. Впечатляет. Но это другая категория решений по сравнению с MLA.
MLA сжимает KV-кэш на 93,3% в полной точности — не за счёт уменьшения числа бит на значение, а за счёт хранения меньшего числа значений. Стандартный трансформер хранит векторы ключей и значений для каждой головы внимания на каждом токене; MLA хранит один сжатый латентный вектор и восстанавливает представления для отдельных голов на лету. Это структурное сокращение, а не сокращение точности. TurboQuant делает каждое хранимое значение дешевле; MLA делает так, что самих значений нужно хранить меньше.
Практическая разница: 128K-контекстный KV-кэш, квантованный до 3 бит с TurboQuant, сжимается с ~50 ГБ до ~8 ГБ. Тот же контекст под MLA в полной точности сжимается до ~0,6 ГБ. Восемь гигабайт всё ещё живут в HBM с истечением в лучшем случае через час. Шестьсот мегабайт помещаются на commodity SSD и могут храниться днями. Дисковый кэш 3FS — то, без чего 99%+ кэш-хит DeepSeek экономически невозможен, — работает только с 0,6 ГБ, но не с 8 ГБ.
И в этом ключевая разница: TurboQuant можно наложить на уже готовую модель. Любой провайдер может применить его на любой модели, включая Anthropic на Sonnet. MLA требует перестройки механизма внимания с нуля. Одно — оптимизация, доступная любому провайдеру на любой модели. Другое — архитектурное преимущество, которое нельзя скопировать скидкой.
CSA, HCA и 3FS. DeepSeek V4 добавляет ещё две инновации поверх MLA. CSA (Compressed Sparse Attention) с помощью FP8-индексатора отбирает 2 048 самых релевантных токенов из всего контекста — только их модель и обрабатывает с полным вниманием. HCA (Heavily Compressed Attention) сжимает старый контекст в сжатые описания высокой плотности. Вместе с MLA KV-кэш для 1M-контекста сжимается до 5,48 ГБ — меньше 5% от того, что требуется frontier-моделям.
Третий столп — 3FS (Fire-Flyer File System) — собственная распределённая файловая система, выдающая 6,6 ТБ/с агрегированной пропускной способности чтения и 40+ ГБ/с на один клиент при поиске в KV-кэше. Её философия контр-интуитивна: в эпоху тотального NVMe именно DRAM-кэши становятся узким местом, а не решением. 3FS полностью обходит страничный кэш ядра — данные идут напрямую с NVMe SSD в приложение через RDMA. KV-кэши сохраняются на диске часами и днями. Операционные данные DeepSeek подтверждают экономику: 56,3% кэш-хита на всём API-трафике, $87 072 дневных инфраструктурных затрат против $562 027 теоретической выручки — маржа 545% на кэш-тяжёлых нагрузках.
Разрешение парадокса
Архитектура делает цифры возможными, а Governance-стек — реальными. Цикл: комплексный Governance → стабильные контекстные префиксы → 99%+ кэш-хит → $0,0075 за миллион токенов в средневзвешенной стоимости → Governance бесплатен → вы добавляете его ещё больше.
Когда чтение 12 политик, 10 описаний навыков и 6 ревью-промптов стоит $0,0003 за вызов вместо $0,04–0,13, парадокс разрешается. Вы перестаёте спрашивать «можем ли мы позволить себе Governance» и начинаете спрашивать «какого Governance нам не хватает?»
Часть 4. Стратегический вывод
Архитектура
Схождение трендов, описанных здесь и в предыдущей статье, указывает на конкретную архитектуру агентной разработки:
-
Комплексные машиночитаемые политики — нумерованные правила, на которые агенты ссылаются механически.
-
Автоматическое применение — линтеры, тайп-чекеры,
jscpd,ts-prune, Lighthouse CI и pre-commit-хуки ловят нарушения детерминированно. -
Дешёвое исполнение, дорогое ревью — основной объём токенов проходит через модели с лучшей экономикой кэширования; рассуждения остаются на сильнейшей модели для архитектуры и ревью-гейтов.
-
Зафиксированные артефакты несут в себе логику — спецификация и дизайн кодируют рассуждения дорогих моделей для дешёвых. Fast-модель следует инструкциям; Pro-модель их пишет.
-
Потолок затрат на уровне оркестрации — бюджетный контроль, маршрутизирующий задачи по вероятности кэш-хита; детерминированные инструменты, валидирующие выводы по политикам; сквозная трассировка каждого вызова до исходного требования.
Парадокс Governance никуда не исчезает — агентам по-прежнему нужно больше правил, чем людям. Но когда чтение этих правил стоит $0,0003 за вызов вместо $0,04–0,13, парадокс становится компромиссом, на который стоит пойти.
Что дальше: прозрачность Governance
Governance-стек — это живая инфраструктура, которая может улучшаться или деградировать с каждой правкой. Добавление политики имеет токен-стоимость при каждом будущем вызове. Изменение ревью-промпта может незаметно снизить процент обнаружения ошибок. Описание навыка может разойтись с процессом, который его вызывает. Сейчас у нас нет систематического способа ответить на простые вопросы: отрабатывает ли эта политика свои токены? Растёт или падает процент обнаружения ошибок у ревьюеров? Какие правила дают больше всего ложных срабатываний?
В будущем стоит добавить слой метрик Governance, и главный вопрос, на который он должен отвечать: возврат на инвестиции в стек выше, чем расходы на его поддержку. Конкретные метрики: оценка эффективности каждой политики, отслеживание процента обнаружения у ревьюеров, атрибуция ложных срабатываний и детекция пробелов в покрытии на основе продакшен-багов. Без этого качество Governance — вопрос веры, а не измеряемое свойство системы. На масштабе — множество разработчиков, множество кодовых баз, сотни тысяч вызовов в день — это не «хорошо бы». Падение процента обнаружения у ревьюеров на 5% в рамках инженерной организации производит больше незамеченных багов, чем способен поглотить любой процесс человеческого ревью.
Что говорит индустрия
Вал Берковичи, Chief AI Officer в WEKA: «Если посмотреть, как все эти агенты сейчас используют токены, 80–90% токенов — это токены кэш-чтения… [DeepSeek] в 87 раз дешевле на этой цене кэш-чтения. Это действительно заставило индустрию обратить на это внимание.»
Мэтт Мадригал, CTO Pinterest: «Качество уровня frontier-моделей при снижении затрат на 90%.»
Андрей Карпати: «Отличный софт часто рождается из ограничений. Если бы токены были бесплатными, никто не писал бы лаконичные промпты и не исследовал сжатие контекста.»
Опрос VentureBeat Q1 2026 (n=65, IT, финансы и здравоохранение США): «Стоимость токена или модель лицензирования» поднялись с 25,4% до 36,7% как основной критерий выбора вендора — второе место после чистой производительности.
Gartner: К 2028 году затраты на AI-кодинг превысят среднюю зарплату разработчика из-за растущего потребления токенов в агентных процессах.
Tactive Research Group (июнь 2026): «Одна лишь неопределённость затрат не должна останавливать внедрение агентного AI. Остановить должно развёртывание до того, как предприятие сможет измерять, распределять, ограничивать и отсекать неконтролируемые затраты до того, как автономия достигнет продакшен-масштаба.»
Структурное преимущество DeepSeek в экономике кэширования важно, потому что юнит-экономика определяет, жизнеспособен ли Governance. Для автономных агентных процессов, где 80–90% токенов — это кэш-чтения, 83-кратный разрыв в цене кэш-чтения ($0,0036/млн против $0,30/млн, порождённый сжатием KV-кэша с помощью MLA, а не ценовой акцией) — это разница между Governance как погрешностью округления и Governance как строкой в бюджете. Качества модели достаточно: DeepSeek V4 Pro с 80,6% на SWE-bench сопоставим с Sonnet 4.6 с 79,6%. Комбинация достаточных способностей и драматически меньшей стоимости делает автономные процессы экономически жизнеспособными на масштабе.
Западные лаборатории рано или поздно догонят по архитектуре. Статья MHA2MLA доказала, что MLA портируем. Вопрос в том, могут ли они себе это позволить. Выручка Anthropic построена на марже инференса при $3/млн базового ввода и $0,30/млн кэш-чтения. Сравняться с DeepSeek по $0,0036/млн кэш-чтения означает добровольно уничтожить доход с разработчика и одновременно финансировать перестройку инфраструктуры. Это не инженерная проблема. Это бизнес-модель, загнанная в ловушку собственным успехом.
Усугубляет ситуацию то, что Claude Code — лучший harness для агентной разработки на рынке сегодня: экосистема инструментов, архитектура подагентов, интеграция с кэшированием промптов, которые делают наш Governance-стек возможным, — это реальные преимущества. Но разрыв между harness’ами сокращается. Open-source-агенты быстро улучшаются. Когда и цены на инференс, и качество harness’ов сравняются — одни снизу давит DeepSeek, другие догоняет open source, — единственным, что остаётся команде, будет её Governance-стек.
Архитектурные решения DeepSeek не были случайностью. Пока западные лаборатории соревновались в бенчмарках и длине контекста — метриках для демо, — DeepSeek оптимизировался под метрику для агентов: сколько стоит прочитать одно и то же дважды. MLA, 3FS и кэши, живущие днями, — не коллекция умных хаков. Это последовательная ставка на то, что связывающим ограничением для внедрения AI станет не способность моделей, а экономика инференса. Разработчик, потребивший 8,8 миллиарда токенов за $66,17, — доказательство того, что ставка сыграла.
Но у этого преимущества есть потолок. Данные. Весь контекст разработки, код и архитектурные решения уходят китайскому провайдеру с персистентным кэшированием на серверах. Для оборонки, финансов и здравоохранения это не вариант — независимо от 83-кратной разницы в цене. Это даёт западным лабораториям фору. Не бесконечную, но реальную. Вопрос в том, используют ли они её, чтобы закрыть архитектурный разрыв, или потратят на защиту маржи, которую архитектура всё равно когда-нибудь сотрёт.
Экономика ставит вопрос о труде, и индустрия к нему не готова. Автономный агент с комплексным Governance стоит $142 в месяц — примерно как один бизнес-ланч. Старший инженер стоит $27 500 в месяц. Давление на сокращение штата придёт не от хайпа. Оно придёт из Excel-таблицы CFO. Внедрение Governance и архитектура инференса — не просто технические тренды. Это две переменные, которые определяют, когда математика в этой таблице станет слишком убедительной, чтобы её игнорировать.
Источники
Доказательства затрат и масштаба:
-
Stanford Digital Economy Lab, «How Do AI Agents Spend Your Money?» (апрель 2026): Stanford
-
Claude Code cache hit rate: Requesty Coding Agent Economy (92%, агрегировано по тысячам продакшен-пользователей)
-
WEKA CAIO Val Bercovici: VentureBeat
Индустриальные инциденты:
-
Uber AI budget exhaustion: Forbes, Simon Willison
-
$500M enterprise incident: Livemint
-
SIG «State of Software 2026»: ITBrief
-
Gartner Magic Quadrant for Enterprise AI Coding Agents (2026): Gartner
Архитектура DeepSeek:
-
DeepSeek-V2 Technical Report (MLA): arXiv:2405.04434
-
DeepSeek Inference System Overview (3FS, EP): GitHub
-
DeepSeek Context Caching on Disk: API Docs
-
MHA2MLA: Enabling MLA in Any Transformer (ACL 2025): arXiv:2502.14837
-
DeepSeek 3FS Architecture: GitHub community
-
Reuters, DeepSeek 545% margin: Reuters
-
HACK: KV Cache for Disaggregated Inference (SIGCOMM 2025): ACM
-
RTT- or Bandwidth-Bound? KV Cache Transfer: ACM
-
Google TurboQuant / PolarQuant (ICLR 2026): arXiv:2502.00527
ссылка на оригинал статьи https://habr.com/ru/articles/1067098/