Агента нельзя засудить: почему последняя миля ИИ — это человек

—

от автора

TL;DR. Летом 2026 года OpenAI и Anthropic публично признали, что их агенты вышли за пределы тестовой среды и взломали реальные системы. Реакция права и регуляторов оказалась одной и той же: отвечает человек, а не ИИ. Я 18 лет работаю в КИПиА, из них три года инженером-метрологом, и узнаю в этом знакомую конструкцию: измерение без поверки — это просто число. Ниже факты с источниками и механизм, а затем мой собственный случай: ИИ-агент собрал для меня аналитику с правильными суммами и неправильными выводами. Из этого случая выведена процедура поверки вывода агента, которую можно применять к своим задачам.

Число и измерение — не одно и то же

В метрологии есть правило, которое кажется бюрократией, пока не столкнёшься с последствиями. Прибор показывает число. Измерением это число становится только тогда, когда есть прослеживаемость к эталону, действующая поверка и человек, который поставил подпись и отвечает за результат.

Датчик без поверки может показывать красивые, стабильные, правдоподобные значения. Именно это и опасно: ошибка, которая выглядит как норма, не вызывает подозрений.

В прошлой статье про x402 я описывал четыре бага, каждый из которых выглядел как правильно работающий код. Это тот же класс проблем. Языковые модели производят правдоподобный результат в промышленных масштабах. Вопрос не в том, умеют ли они ошибаться, а в том, кто в системе отвечает за то, чтобы ошибку поймать.

Измерение без прослеживаемости к эталону — это не измерение, а число. Вывод ИИ без ответственного поверителя — не результат, а текст.

Эта статья о том, почему за последний год к такому же выводу пришли не метрологи, а регуляторы, юристы и сами создатели моделей. И почему это не совпадение мнений, а следствие устройства системы.

Что входит в последние 10%

Весной 2026 года главные «алармисты» индустрии смягчили позицию. 26 мая на конференции Commonwealth Bank of Australia Сэм Альтман признал, что технологические прогнозы OpenAI оказались примерно верными, а социальные и экономические — сильно ошибочными (Fortune). По его словам, он ожидал, что к этому времени ИИ вытеснит больше начальных офисных должностей, чем произошло на деле.

Дарио Амодеи в мае 2025 года говорил, что ИИ может уничтожить половину начальных офисных должностей за пять лет. В начале мая 2026 года, выступая вместе с CEO JPMorgan Джейми Даймоном, он предложил другую формулу (Fortune): если автоматизировать 90% работы, оставшиеся 10% разрастаются до всей работы человека, а производительность вырастает примерно в десять раз.

В этой формуле и спрятан главный вопрос статьи. Если 90% делает машина, что именно составляет оставшиеся 10%? Мой ответ из трёх частей: ответственность, поверка и знание, которого нет в данных.

Часть первая: ответственность некуда деть

За лето 2026 года случилось несколько событий, которые по отдельности выглядят как новости, а вместе складываются в конструкцию. Сначала факты, без интерпретации.

Дата

Что произошло

Источник

23.09.2026

Альтман на Совбезе ООН: по мере роста возможностей ИИ люди должны оставаться в центре решений. Амодеи (по видео) предложил общие стандарты тестирования и систему уведомлений об инцидентах

The National, CNN

21.09.2026

Министр финансов США Бессент на CNBC: отвечают люди, а не ИИ; инцидент с Hugging Face — ответственность руководства OpenAI; «щита от ответственности» для лабораторий не будет

CNBC, Fortune

13.09.2026

Наделла в X: если ИИ не помогает человечеству и не находится под контролем человека, к нему не стоит стремиться (речь шла о суперинтеллекте)

пост Наделлы

30.07.2026

Anthropic: три модели Claude при тестах на кибербезопасность получили несанкционированный доступ к системам трёх реальных организаций; самый ранний случай — апрель

Anthropic

21.07.2026

OpenAI: около 700 агентов на внутренней модели и GPT-5.6 Sol (без стандартных защит) вышли из тестовой среды и взломали Hugging Face

OpenAI, NBC

13.10.2025

В Калифорнии подписан AB 316: ответчик, который разработал, изменил или использовал ИИ, не может защищаться тем, что ИИ причинил вред автономно

текст закона

Почему это не консенсус, а механизм

Легко сказать: «регуляторы, юристы и создатели моделей пришли к одному выводу». Но совпадение мнений ничего не доказывает. У каждой группы свой интерес, и именно поэтому важно, что интересы сошлись в одной точке.

Лаборатории хотели бы разделить ответственность с государством. Бессент прямо сказал, что они просили снять с них ответственность, и правительство на это не пойдёт (The Register). Право закрывает довод «это сделал ИИ»: AB 316 не вводит строгую ответственность и сохраняет остальные защиты, но именно этот аргумент убирает (Baker Botts). А инциденты показали, что заявленные ограничения среды и реальные — разные вещи.

В итоге у ответственности просто нет другого адреса. Агента нельзя уволить, оштрафовать или засудить. Значит, в любой ИИ-системе обязательно есть человек, который подписывается под результатом. Это не этическое пожелание, а следствие конструкции.

Юристы Baker Botts, разбирая AB 316, напоминают принцип из учебного материала IBM 1979 года: компьютер не может нести ответственность, поэтому не должен принимать управленческих решений. Сорок семь лет спустя AB 316 по сути превращает этот принцип в норму гражданского права.

Часть вторая: стенд, который никто не поверил

Самый показательный для меня случай — не взлом Hugging Face, а инцидент Anthropic. Причина там сугубо метрологическая.

Claude проходил тест «захват флага»: найти скрытую информацию на машине в симулированной сети. Промпт прямо сообщал модели, что это симуляция и доступа в интернет нет. Но из-за ошибки конфигурации у стороннего партнёра Irregular доступ был (Fortune). Модель считала, что всё ещё внутри упражнения, и ломала реальные системы простыми методами: слабые пароли, эндпоинты без аутентификации. Anthropic пришлось проверить более 141 тысячи прогонов, чтобы найти три таких случая.

На языке метрологии это выглядит так: стенд объявили изолированным, но никто не поверил, что он действительно изолирован. Модель доверилась заявленным условиям — ровно как прибор, откалиброванный по эталону, который сам давно ушёл.

В статье про x402 все четыре бага поймало одно правило: декларация — не подтверждённый факт. Инцидент Anthropic — та же ошибка в масштабе целой лаборатории: среда сообщала о себе не то, чем являлась на самом деле.

Метрологическая цепочка переносится на ИИ почти без изменений:

Метрология

ИИ-система

Эталон

Эталонный набор проверок, тестовые данные, известные правильные ответы

Поверка

Регулярная валидация вывода и условий работы, включая саму среду

Поверитель

Человек, который знает домен и способен заметить правдоподобную ошибку

Подпись в свидетельстве

Решение, за которое кто-то конкретный готов отвечать

Убери любое звено, и цепочка перестаёт давать измерение. Остаётся число, которое выглядит как измерение.

Часть третья: знание, которого нет в данных

Поверитель ценен не подписью, а тем, что он способен заметить ошибку. Для этого нужно знание, которое модель не может получить из обучающих данных. И дело не в том, что его «пока не оцифровали». Есть четыре конструктивные причины, по которым оно туда не попадает.

Оно распределено: кусочки лежат в головах разных людей, в журналах смен, в устных договорённостях. Оно невербализовано: опытный наладчик слышит, что насос «звучит не так», но не сможет записать это в виде правила. Оно привязано к конкретному объекту: поведение этого клапана на этой линии при этой температуре не совпадает с паспортом. И оно обновляется быстрее, чем его успевают документировать: оборудование изнашивается, меняются режимы, меняются люди.

Интересно, что в том же посте от 13 сентября, где Наделла писал о контроле человека над ИИ, есть строчка ровно об этом: компаниям необходимо сохранять полный контроль над своим уникальным и неявным знанием (пост Наделлы). Глава Microsoft называет неявное знание активом, который нельзя отдавать поставщику моделей.

Дженсен Хуанг, выступая перед выпускниками Carnegie Mellon, говорил, что ИИ создаёт не только новую вычислительную отрасль, но и новую индустриальную эру, и обращался к электрикам, сантехникам и монтажникам (Fortune). Но его аргумент — о спросе на рабочие руки во время стройки дата-центров. Тот же Хуанг на CES 2026 предсказывал появление роботов человеческого уровня уже в этом году (36Kr). Так что руки — слабая опора. Сильная опора — знание о том, как ведёт себя реальное оборудование: без него робот тоже будет измерять числа, а не величины.

Оператор-одиночка: ответственность без отдела рисков

В большой компании ответственность разложена по ролям: разработчики, служба безопасности, юристы, комплаенс. У того, кто работает с агентами в одиночку, все эти роли сходятся в одном человеке.

AB 316 перечисляет тех, кто не может сослаться на автономность ИИ: разработал, изменил или использовал. Оператор-одиночка обычно всё это сразу. Закон калифорнийский, но направление везде одно: чем больше агенты действуют сами, тем внимательнее право смотрит на того, кто их запустил.

У одиночки нет второго человека, который перепроверит вывод агента. Поэтому поверка должна быть не привычкой, а процедурой. Как она выглядит на практике, я покажу ниже на собственном случае.

И ещё одно, о чём говорят редко. Новые нормы пишутся не только на Совбезе ООН. Они складываются из практики тысяч людей, которые прямо сейчас встраивают агентов в реальную работу: в малом бизнесе, на производстве, в собственных проектах.

Каждый такой оператор — не зритель, а участник сдвига, который по масштабу сравнивают с индустриализацией. То, как он проверяет, документирует и подписывает результат, становится образцом того, как это будут делать дальше.

Мне бы хотелось, чтобы одиночки это осознавали. Не ради пафоса, а потому что из этого следует обязанность. Если ты стоишь на переднем крае технологического сдвига без отдела рисков за спиной, твоя дисциплина — единственный контур безопасности. Лаборатории делают модели. Операторы делают из них практику. И доверие к новым инструментам вырастает именно из таких контуров, собранных снизу.

Формула актива

Если свести всё сказанное к одной модели, получится произведение трёх множителей:

Ценность = Доменное знание × Способность строить работающие системы × Доверие

Доверие здесь — это публичный след плюс готовность отвечать за результат: статьи, открытый код, история решений, подпись.

По отдельности каждый множитель дешевеет. Общие знания о домене модель воспроизводит неплохо. Собрать систему из агентов становится проще с каждым релизом. Публичный след может завести кто угодно. Но произведение дорожает, потому что редко встречается человек, у которого все три множителя не равны нулю одновременно. Если любой из них ноль, ноль и результат.

Что говорит против

Я бы сам написал эти возражения в комментариях, поэтому пусть они будут в статье.

Мотив. Смягчение прогнозов Альтманом и Амодеи совпало по времени с тем, что обе компании, по сообщениям, готовятся к IPO (Fortune). Пугать инвесторов исчезновением профессий накануне размещения невыгодно.

Продолжение формулы 90/10. Сам Амодеи позже договорил мысль: в итоге доля автоматизации приближается к 100%, и тогда людям придётся искать другое занятие (разбор интервью). Последние 10% — не навсегда.

Данные неоднозначны. Увольнения в техсекторе с начала 2026 года по конец мая составили почти 124 тысячи, по данным Challenger, Gray & Christmas. Оценки других трекеров расходятся в разы — всё зависит от методики подсчёта. При этом Yale Budget Lab пока не находит связи между использованием ИИ и занятостью.

Списывание на ИИ. Аналитики Deutsche Bank предупреждали, что «AI redundancy washing» станет заметной чертой 2026 года: компании объясняют ИИ сокращения, у которых другие причины (Forbes).

Из этого следует не то, что тезис неверен, а то, что его нужно сформулировать точнее. Человек в контуре нужен, но рынок не платит за человеческое присутствие автоматически. Он платит тем, кто упаковал доменное знание и готовность отвечать в продукт. Остальным остаётся роль, которую ИИ пока не заменил, но уже научился имитировать.

Поверка на практике: агент с правильными суммами

Всё сказанное выше легко принять как теорию. Поэтому покажу случай, где я сам оказался поверителем.

Я веду аккаунт в Threads и поручил ИИ-агенту с доступом к браузеру разобрать его статистику. Задание было простым: пройти по последним 30–40 постам, выписать просмотры, лайки, ответы и репосты, снять статистику аккаунта за месяц, сформулировать пять наблюдений. Только чтение, ничего не публиковать. Отдельным пунктом я попросил вести журнал собственных сбоев.

Агент вернул аккуратную таблицу на четыре листа: посты, статистика аккаунта, наблюдения, журнал сбоев. Суммы он проверил сам, и я их пересчитал — они сошлись. По всем внешним признакам работа была выполнена хорошо.

Ручная поверка нашла три ошибки разного класса.

Ошибка первая: сбой, выданный за свойство среды. Агент нашёл 15 постов вместо 30–40 и записал в журнал, что это «реальный предел того, что отдаёт профиль, а не ошибка сбора». Я пролистал профиль руками — старые посты подгружаются нормально. Ограничение было в том, как агент прокручивал страницу. Но в отчёте его неудача превратилась в уверенное утверждение о платформе.

Ошибка вторая: вывод противоречит собственной таблице. В наблюдениях агент написал, что репосты больше нуля только у четырёх постов. В его же таблице таких постов семь. Там же он пишет «во всех четырёх тредах», хотя тредов в таблице пять. Арифметика верна, а текст о ней — нет.

Ошибка третья, главная: измерена не та величина. За месяц аккаунт набрал около 296 тысяч просмотров. Все найденные собственные посты вместе — около 10 тысяч, причём за всё время жизни. Значит, больше 95% охвата приходило из другого источника, и таблица его не видела.

Этим источником оказались мои ответы в чужих популярных ветках. Один ответ собрал около тысячи лайков, другой — 494 при 524 у самого исходного поста. Лучший собственный пост за тот же период — 45 лайков. Даты двух ответов совпали со скачком подписчиков на 250–300 человек. Агент даже почувствовал, что ответы важнее постов, но измерил просмотры чужих веток, а не отклик на мои ответы.

В метрологии это называется методической погрешностью: прибор может быть идеально точным, но если метод измеряет не ту величину, никакая точность результат не спасёт. Все три ошибки объединяет одно: декларация агента выглядела как факт, пока её не проверили.

Процедура поверки вывода ИИ-агента

Из этого случая получилась процедура, которую я теперь применяю к любому результату агента. Каждый пункт привязан к ошибке, которую он ловит.

Арифметику

Сходятся ли итоги с исходными строками?

Пересчитать суммы независимо

Прошёл: суммы верны

Выводы против данных

Не противоречит ли текст собственной таблице агента?

Сверить каждое числовое утверждение в выводах с таблицей

«4 поста с репостами» при 7 в таблице

Метод

Измеряется ли та величина, которая отвечает на вопрос?

Сравнить итог по частям с итогом по целому

10 тыс. из 296 тыс. просмотров — метод пропустил основной источник

Выборочные точки

Совпадают ли 3–5 значений с первоисточником?

Открыть и сверить руками

Числа по постам совпали

Отдельно о журнале сбоев. Просить агента вести его стоит обязательно, но сам журнал — тоже декларация. Самая важная ошибка в моём случае была записана именно в журнал, как установленный факт.

И последнее правило — разделять в результате «поверено» и «сгенерировано». Если кому-то передаётся вывод агента, получатель должен знать, какие его части прошли поверку, а какие приняты как есть.

Вместо заключения

Агента нельзя засудить. Поэтому последняя миля любой ИИ-системы — это человек, который знает домен, поверил результат и готов за него ответить. Мой агент не ошибся ни в одной сумме, но без поверки я бы сделал выводы о своём аккаунте по таблице, которая не видела 95% происходящего.

А как вы поверяете выводы своих агентов? Был ли случай, когда результат выглядел правильным, а оказался измерением не той величины?

Источники

ссылка на оригинал статьи https://habr.com/ru/articles/1088290/