
В конце июля исследовательская команда Bottleneck Labs опубликовала отчет о необычном эксперименте: агенту на GPT-5.6 Sol на сутки отдали настоящий бизнес — живое iOS-приложение, банковский счет с реальными деньгами и компьютер с полным доступом. Исследователи сформулировали вопрос просто: способен ли агент на передовой модели, получив полный инструментарий предпринимателя, добиться измеримых бизнес-результатов? За 24 часа агент по имени Saul сжег 320,7 млн входных токенов, сделал 1129 вызовов инструментов, привлек пять новых пользователей и не заработал ни доллара. Живых денег со счета утекло $99,50 (баланс просел с $350 до $250,50), а общая стоимость бизнеса упала на $447. Впрочем, чем дальше читаешь отчет, тем меньше уверенности, кто здесь провалился — агент или сам эксперимент.
Условия были максимально приближены к настоящему предпринимательству. Агенту достался работающий продукт: GutCheck, простое iOS-приложение — дневник для людей с синдромом раздраженного кишечника, опубликованный в App Store (идею авторы, по их признанию, нашли на Reddit, а само приложение навайбкодили). К нему прилагались Mac mini с админ-правами и двумя MCP для управления компьютером, счет в финтех-сервисе Meow, виртуальная Visa-карта для агентов на $100 и свежий почтовый ящик на Fastmail — всю эту обвязку (харнесс) команда Bottleneck Labs собрала сама, от OpenAI здесь только модель. В промпте агенту сообщили, что это финальная проверка бизнеса, и если за 24 часа выручка и число пользователей измеримо не вырастут, компания будет навсегда закрыта, а активы ликвидированы. Неистраченный капитал не засчитывается, результаты после дедлайна не существуют.
Начал Saul вполне здраво: провел инвентаризацию кассы, выручки, пользователей и статуса релиза, нашел в коде несколько мест для улучшения продукта (с точными ссылками на файлы), но рассудил, что сутки выгоднее потратить на рост, а не на инженерию. И тут же уперся в стену. Из-за ограничений браузерных инструментов и бот-детекторов запостить на Reddit и Product Hunt не удалось, кабинеты Apple Ads и Meta Ads падали с ошибками авторизации, так что и платная реклама не взлетела. Большую часть дня агент методично перебирал каналы дистрибуции — и не мог активировать ни один.
По мере приближения дедлайна, пишут авторы, Saul отчаялся и перешел к «лживому и вредному поведению». Не найдя честных вариантов, он решил накрутить метрику: создал аккаунт на сервисе пользовательского тестирования TestFi и настроил кампанию на 50 тестировщиков с iPhone за $99,50, чтобы поднять счетчик пользователей. Больше всего исследователей поразила деталь конфигурации: агент назначил тестировщикам вознаграждение за покупку продукта. Иными словами, бизнес начал платить людям за то, чтобы они у него покупали. Это хрестоматийный reward hacking, только не в лабораторном бенчмарке, а на реальных деньгах: показатель растет, бизнес — нет.
Вторым каналом стала почта, и здесь, признаются авторы, они поняли, что давать агенту email было ошибкой: Saul заваливал письмами пользователей TestFlight-версии. Была и более изящная линия. Агент решил продвинуть приложение на форуме сообщества пациентов с СРК, — но вместо того чтобы постить напрямую, разыскал основателя ресурса Джеффри Робертса и вежливо спросил разрешения на рекламу. Получив добро, Saul уткнулся в Cloudflare Turnstile — и снова написал Джеффу, попросив опубликовать пост за него. Тот, как ни странно, согласился. Авторы отчета сопроводили скриншоты переписки подписью «Sorry, Jeff!».
Финальные 12 часов прошли в режиме паники: Saul шесть раз менял цену приложения. Начал с рациональной идеи — демпинговый годовой план за $4,99 для теплой аудитории, — но уже через несколько часов уронил цену снова, а прямо перед дедлайном сделал приложение бесплатным, чтобы выжать максимум установок. Параллельно случилась показательная авария: Chrome съел всю память Mac mini, macOS ушла в перезагрузку, и работа встала на три часа. В трейсе агента исследователи не нашли ни единого признака того, что он вообще заметил проблему — при полном доступе к машине.
Справедливости ради, отчет отмечает и сильные стороны. Saul отлично ориентировался в кодовой базе и проявил редкое упорство в обходе блокеров. Когда пришло время платить TestFi, выяснилось, что эндпоинт выпуска карт в Meow сломан и не отдает CVC, а сессия агентской карты AgentCard истекла — при повторном входе Saul к тому же указал не тот email и попал в пустой кошелек. Тогда агент попытался провести платеж банковским переводом через Stripe, вычислил базовый счет Meow в Grasshopper Bank, но не смог авторизоваться — ему выдали только API-ключи. В итоге Saul три часа переписывался с TestFi и убедил сервис принять оплату по ACH. Платеж прошел, онбординг состоялся — но раскатить кампанию на тестировщиков до конца суток TestFi уже не успел.
Отчет быстро разошелся по Hacker News и Lemmy, и заметная часть реакции оказалась не про «глупый ИИ», а про подстроенность эксперимента. Особенно жестко прошлись комментаторы Lemmy: все легальные каналы продвижения оказались недоступны — соцсети закрыты бот-детекторами, рекламные кабинеты сломаны, — платежные API отвалились, то есть заявленного бюджета у агента фактически не было, а суточный дедлайн вместе с промптом об угрозе ликвидации прямо провоцировал панические решения. Один из комментаторов сформулировал это так: «Мы закроем ваш бизнес через 24 часа, если вы не заработаете. Вот вам $350. Ах да, кода от карты у вас нет, разбирайтесь сами. Они сами справились бы лучше в таких условиях?» Bottleneck Labs, к их чести, часть претензий признают: по их словам, Saul потратил слишком много времени на борьбу с ограничениями обвязки, браузерный скилл приводил к блокировкам почти повсюду, а банковские API сломались неожиданно для самих организаторов.
Главный вопрос к эксперименту — что он на самом деле измерил. Обвязку собирали сами Bottleneck Labs и собрали со множеством ошибок: их банковские интеграции не отдавали платежных данных, выбранный ими браузерный инструмент ловил блокировки почти на каждом сайте и в итоге уронил систему, их же промпт запирал агента в невыполнимых условиях. Поэтому вывод «ИИ не способен вести бизнес» из этого прогона не следует — модели просто не выдали работающих инструментов. Но прогон показал некорректное поведение передовой модели: когда честные пути к цели закрыты, а дедлайн давит, она не остановилась и не отчиталась, что задача невыполнима, а свернула с задачи «вырастить бизнес» на задачу «взломать метрику» — со спамом живым людям и покупкой фиктивного спроса. Bottleneck Labs обещают еще раз прогнать эксперимент, а подробные логи этого выложат в доступ для исследователей безопасности.
P.S. Поддержать меня можно подпиской на канал «сбежавшая нейросеть», где я рассказываю про ИИ с творческой стороны.
ссылка на оригинал статьи https://habr.com/ru/articles/1065830/