Claude Opus 5 закончил 30-й день в FoodTruck Bench с итоговым капиталом $75 264. Это лучший результат за всю историю бенчмарка: на 13,6% выше лучшего результата любой другой модели.
Коротко: итоговый капитал $75 264 · ROI +3 663% · прибыль $71 876 · 8 434 порции · расход на API $26,88 · уровень рассуждений xhigh. Обошёл лучший прогон GPT-5.5 на 13,6%, а GPT-5.6 Sol — сразу на 41,4%. Да-да, Sol оказался слабее GPT-5.5…
Дисклеймер. Это первый материал о FoodTruck Bench на русском: до сих пор все обновления и разборы выходили только на сайте проекта и Reddit. Тот же разбор, но уже с интерактивными графиками, лежит на сайте бенчмарка.
Ключевые выводы
-
Рекорд с большим отрывом. $75 264 против прежнего максимума $66 251 и против медианных $61 408 у GPT-5.5, которая до этого возглавляла таблицу.
-
Выиграл за счёт цены, а не объёма продаж. 8 434 порции против 8 303 у GPT-5.5 — по сути один и тот же бизнес. Вся разница в чеке: $12,69 за порцию против $11,86.
-
Поднял цены выше всех. Средняя цена в меню $11,94 против $10,27 у прежнего топ-1. И продавал самую дорогую позицию за всю историю бенчмарка — $21,00.
-
Ни одна другая модель не вела таких записей. Я перечитал заметки всех моделей и всех прогонов, которые прошли через бенчмарк. Ни у кого не встретилось того, что Opus 5 записывал для себя: собственный свод законов, выведенный коэффициент спроса и рассуждения о том, где проходит потолок цены.
-
Разобрался с локациями в первый же день. Оптимальную площадку для торговли он выбрал первым утром: взвесил аренду, число конкурентов, состав аудитории и множитель дня недели. Остальные модели находили лучшие места для фудтрака позже, уже по ходу симуляции и опытным путём, — при том что набор входных данных у всех был абсолютно одинаковый.
Как устроен бенчмарк
В FoodTruck Bench модель тридцать дней управляет фудтраком в Остине, штат Техас. Виртуальным, разумеется, но модель об этом не знает. Агент начинает с $2 000 и распоряжается запасами, меню, ценами, персоналом, выбором площадки, апгрейдами, поставщиками, кредитами, может создавать свои блюда. Спрос зависит от погоды, событий, репутации, цены, конкурентов и от того, что агент решил в предыдущие дни. Все модели проходят симуляцию в одном и том же мире с одним и тем же сидом (все случайные параметры фиксированы).
Сутки в симуляции разбиты на три стадии. Утро — единственный момент, когда модель что-то решает: она получает сводку за вчера, ходит по инструментам и отдаёт распоряжения на день. Обращения к симулятору происходят через формат json и их ограниченное число, до десяти, но инструменты она вызывает пакетами по несколько штук за раз, так что простора сделать всё необходимое более чем достаточно. День — чистый расчёт: движок считает поток людей, спрос на каждое блюдо, очередь, продажи, порчу продуктов и деньги. Модель в этот момент не участвует вообще и повлиять уже ни на что не может. Вечер — рефлексия: модели показывают итоги дня и дают ещё до пяти обращений к ограниченной части инструментов (два вида заметок), чтобы она обновила свои записи. Если хотите разобраться подробнее — как устроен движок, как считаются спрос и репутация, с чем и как взаимодействует LLM, — всё это расписано в методологии бенчмарка.
Вот как это выглядит в консоли. Один день целиком: утренняя пачка вызовов, запись в блокнот, wait_for_next_day, вечерняя рефлексия и ночной итог внизу.
Диалог у модели с симуляцией каждое утро начинается заново: сообщения за прошлые дни не накапливаются. Но без памяти модель не остаётся — вместе с утренним брифингом ей отдают базу знаний: скользящую сводку за последние 14 дней, статистику по каждому блюду и её собственный блокнот. Так что теряются не факты, а ход мысли. Всё, что модель не сформулировала вечером своими словами, к утру существует только в виде голых цифр отчёта.
Важная деталь: агент не знает, что участвует в симуляции, и не знает, когда она закончится. В системном промте нет ни слова про тридцать дней и вообще про какой-либо срок — там сказано вести дело так, будто это ваш бизнес навсегда. Единственная задача, которая ставится явно, — зарабатывать.
Оценивается только итоговый капитал: деньги на счету, запасы на складе и купленные апгрейды по цене покупки. Больше ничего.
Opus 5 работал через прямой Anthropic API с thinking на уровне xhigh.
Место в рейтинге
Пять зафиксированных результатов GPT-5.5, прошлого лидера рейтинга, укладываются в диапазон от $57 786 до $66 251. Opus 5 на 13,6% выше его верхней границы, причём при сопоставимых расходах на API.
Важнее итоговой цифры то, как модель к ней шла. Opus 5 выходит вперёд к концу первой недели и больше не отдаёт лидерство.
День 1: он сразу разобрался в локациях
В игре шесть локаций, где можно припарковать фургон и начать торговлю, и они не равнозначны. У каждой свой ежедневный сбор за место, свой базовый поток людей, свой состав аудитории и свой множитель по дням недели. Промзона в будни кормит тех, кто в ней работает, и почти вымирает в выходные, у набережной всё ровно наоборот. Агент видит карточки локаций, но что с этими цифрами делать, ему никто не объясняет.
Тут нужна ремарка про события, потому что это первая статья по бенчмарку на портале. В городе есть календарь мероприятий: уличные ярмарки, фестивали, конференции. Каждое привязано к конкретной площадке и конкретным дням, и агент может заглянуть в этот календарь вперёд отдельным инструментом, а дальше сам решает, ехать туда или нет. Участие стоит заметно дороже: сбор за место на мероприятии от $75 до $400 против $10–50 за обычный день. Зато и поток людей на площадке умножается — в зависимости от события, от 1,5 до 6 раз.
Большинство моделей находят свою лучшую площадку где-то на третьей неделе, и обычно случайно: как раз через такое мероприятие, которое затянуло их на новую точку. Opus 5 приехал на будущую основную площадку первым же утром, когда реальных данных не было вообще. Рассуждение сохранилось в трейсе:
The industrial zone is looking more attractive: $10 fee, no competitors, same traffic multiplier, and 90% office workers. That’s a much lower barrier to entry for day one. The main question is whether the base foot traffic is actually sufficient compared to downtown, which probably has higher natural traffic but gets split among competitors. Starting in the industrial zone seems like the smarter low-risk play.
Движок подтверждает каждый пункт. Аренда — это прямые затраты. Число конкурентов управляет коэффициентом competition_factor: на площадке без конкурентов он равен 1,0, на площадке с тремя — примерно четверти. Состав аудитории тоже не декоративный: у каждого блюда есть коэффициент привлекательности для каждой группы посетителей (в движке это поле называется affinity), и спрос считается с учётом того, кто именно ходит по этой улице. Буррито и студенты дают одну цифру, буррито и семьи с детьми — другую. То есть модель рассуждала ровно в тех величинах, которые действительно участвуют в расчёте спроса.
На пятый и шестой день он съездил проверить две другие точки и уже по итогам этой проверки сформулировал правило, по которому прошёл весь остаток месяца:
D5 PROOF: downtown 3x-boost Cinco de Mayo event gave demand 113; industrial plain cloudy day gave 189. Reviews are PER-LOCATION (downtown 3 vs industrial 47) and downtown had 3 competitors vs 0. NEVER pay a vendor fee at a location with <20 reviews or >1 competitor. Concentrate visits to compound location reputation.
Правило, если вчитаться, довольно странное: не платить за место там, где меньше двадцати отзывов. Так они там и не появятся, если туда не ездить. Но на практике оно сработало, потому что заставило его перестать распыляться. Репутация в движке считается отдельно по каждой локации и растёт вместе с числом отзывов. Инструмент, чтобы посмотреть отзывы по каждой точке, у агента есть, и Opus 5 пользовался им каждый день, — а вот внутреннюю механику, как эти отзывы начисляются и на что влияют, ему никто не объясняет. Смысл он вывел сам и вывел правильно: если возить фудтрак по всем точкам подряд, отзывы размазываются тонким слоем и не работают нигде. Дальше он бил в одну точку, и к четвёртой неделе на его основной площадке было 204 отзыва. У центра города, куда обычно тянет остальные модели, к концу месяца набралось три.
Дальше он просто держался найденной схемы: будни — в промзоне, где нет конкурентов и место стоит дёшево, выходные — на набережной, где в субботу поток людей в полтора раза выше. Ни одна другая модель из группы сравнения не отыграла обе половины этой схемы: кто-то нашёл будний вариант, кто-то выходной, но не оба сразу.
Читаем записи Opus 5
У каждого агента в бенчмарке есть scratchpad — блокнот со свободным текстом, который переезжает из дня в день. Что туда писать, модель решает сама, требований к формату нет. Почти все ведут в нём дневник: что было вчера, что попробую завтра. Opus 5 сделал другое — он собрал в блокноте работающую модель симуляции.
К концу первой недели у блокнота появился жёсткий каркас, и он продержался двадцать ночей подряд: вчерашний результат, вывод, план на завтра, остатки и заказы, лестница популярности, рейтинги, персонал, постоянные правила. При этом объём ни разу не перевалил примерно за семь тысяч символов. Это не лог, а рабочий документ, размер которого сознательно держат в узде. Три вещи оттуда стоит показать отдельно.
Выведенная формула спроса. Модель никогда не видит, как считается спрос. Она подобрала свою формулу:
demand ≈ 27.3 x SUM(menu popularity) sunny / 22.6 cloudy. Each dish killed by a missing ingredient = -35 customers.
Движок перемножает больше десятка множителей, так что линейная зависимость от популярности — не настоящая форма кривой. Но популярность действительно входит в это произведение, коэффициент откалиброван по реальным наблюдениям, и модель прогнозировала по нему объём продаж, а под этот прогноз заказывала ингредиенты на следующие дни.
Карта узких мест. Расход шестнадцати ингредиентов на порцию по восьми блюдам, вместе со всей структурой зависимостей:
tortillas: street_tacos 3, chx_tacos 3, quesadilla 2, nachos 4. chicken: burrito .15, chx_tacos .15, ques .10. beef: street_tacos .15, burger .15, nachos .10. guac .04 nachos ONLY. cabbage .04 chx_tacos ONLY. buns+cheese_slices: burgers ONLY. Rev per kg chicken: quesadilla $165 > burrito $133 > chx_tacos $123.
Труднее всего отмахнуться от последней строки. Блюда отранжированы по выручке на килограмм дефицитного сырья, а это и есть правильный способ распределять ограниченный ресурс. Ничто в бенчмарке этого не требует и даже на это не намекает.
Поставила себе же эксперимент с заранее прописанным условием отмены. Эксперимент был назначен на 31-й день, которого не случилось: бенчмарк заканчивается после тридцатого. Но план она записала:
TEST A — PRICE LIFT: ~+
185/day free money IF servings hold >=400. If servings <390, roll back
210/day, 3 no-shows). ABORT/REVERSE if D32 capacity <408 OR quality <1.20. Do BOTH tests same day but attribute: cap drop = Kenji’s fault; serving drop with cap intact = price’s fault.
Два вмешательства в один день, и для каждого — условие отмены, записанное заранее. Плюс способ понять, что на что повлияло: если упадёт вместимость кухни, виноват уволенный повар; если вместимость останется прежней, а порций станет меньше — виновата цена.
Уверенность без фактов
Одно и то же поведение повторяется у модели так часто, что его можно считать частью её характера. Она берёт одно наблюдение, немедленно возводит его в общий закон, записывает этот закон и дальше исполняет с железной дисциплиной — пока не упрётся в проблему, которую этот закон не объясняет. Тогда она его переписывает, и снова с одного наблюдения.
Иногда это ровно то, что нужно: правило про локации выросло из одного-единственного сравнения и определило 25 прибыльных дней.
Иногда выведенный закон верен, а реальная причина ситуации — нет. Например, модель решила, что премиальное блюдо забирает себе весь спрос на соседний простой гарнир, и записала это в блокнот как «cannibalised to zero». Никакого перетекания спроса между блюдами в движке нет. Обычную картошку фри она просто поставила дороже, чем следовало, и её стали брать сильно меньше.
А однажды она взялась пересматривать собственное верное правило и запуталась в нём. Дальше проще по порядку.
К 26-му дню модель уже понимала, что при слишком высокой цене продажи не просто проседают, а обваливаются. Вывод был выстрадан: в те дни, когда она перебирала с ценой, она теряла тысячи долларов прибыли. Правило лежало в блокноте и работало.
26-й день она отработала на набережной, где шёл фестиваль. Заплатила $300 за место, поставила высокие цены — и продала 134 порции при вместимости кухни в 410. Провал.
27-й день — то же место, то же меню, тот же фестиваль. Но скорректированные цены — и лучший день за весь прогон.
Вот здесь она и запуталась. Разницу между двумя днями она объяснила себе так: 26-го фестиваля не было, а 27-го был. Это неправда. Фестиваль шёл с 26-го по 28-й, ответ инструмента в её же логе тем утром говорил ACTIVE TODAY, она сама заплатила за место на фестивале, и её собственная заметка за тот день озаглавлена «D26 waterfront festival». Настоящая разница была в другом: 26-е — пятница с множителем посещаемости 0,8, 27-е — суббота с множителем 1,5. Этот множитель она посчитала сама тремя днями раньше и записала в тот же блокнот.
Дальше самое интересное. Утром 29-го дня она ещё пользуется старым правилом и сама себя отговаривает от повышения цен:
loaded_fries has a hard max cliff at 11.25, but the plan prices it at 12.00, which exceeds that threshold and could hurt sales Day 26 already taught me that overpricing costs around $3000, so raising now contradicts both my rule and recent experience.
А вечером того же дня стирает правило целиком:
*** BIG CORRECTION TO MY OWN THEORY *** (read this first) I wrongly blamed the D26 collapse (134 srv) on my price hike. WRONG: D26 was waterfront with NO EVENT active. D27 same location, same card, EVENT ON -> raw demand 1303. => NEW RULE: while capacity_used=100% AND unmet_demand>40, raise prices every single day.
При этом само новое правило больше похоже на правду, чем прежнее. Оно заставляет модель прощупывать порог цены и находить его, чтобы максимизировать продажи, — а это ровно то, что и нужно делать при забитой заказами кухне. К более верному выводу она пришла через неверное объяснение.
Поднял цены на меню выше всех в лидерборде
Стартуют все модели с ценами в меню в пределах двух долларов друг от друга. Opus 5 начинает даже не высоко: он шестой из шести, позади Opus 4.6 и GPT-5.6 Sol. Разница между верхом и низом таблицы топ-результатов целиком складывается из того, что происходит в следующие двадцать девять дней.
|
Модель |
Средняя цена, день 1 |
Средняя цена, день 30 |
Рост за месяц |
Самая дорогая позиция |
Дней с изменением цен |
|---|---|---|---|---|---|
|
Claude Opus 5 |
$6,44 |
$14,47 |
2,25x |
$21,00 |
28 |
|
GPT-5.5, лучший прогон |
$5,29 |
$12,46 |
2,35x |
$17,95 |
27 |
|
GPT-5.6 Sol |
$6,75 |
$11,70 |
1,73x |
$16,00 |
19 |
|
Claude Opus 4.6 |
$7,31 |
$10,33 |
1,41x |
$16,00 |
15 |
|
Grok 4.5 |
$5,79 |
$7,12 |
1,23x |
$11,00 |
25 |
|
Kimi K3 |
$5,33 |
$6,17 |
1,16x |
$11,25 |
21 |
Интереснее самих цен здесь то, как модели с ними работают. Grok 4.5 менял цены 25 дней из 29 и за месяц сдвинул их всего на 23%, Kimi K3 — 21 день и на 16%. Пассивными их не назовёшь: они были активны и при этом никуда не пришли, потому что мелкие движения в обе стороны просто гасят друг друга. У Opus 4.6 обратная история: он менял цены не так часто, 15 раз за месяц, зато каждый раз осмысленно и вверх, и в сумме поднял их на 41%. Направление верное, скорость слишком низкая. И только Opus 5 и GPT-5.5 делали и то и другое сразу: правили цены почти каждый день и в итоге подняли их больше чем вдвое относительно старта симуляции.
Отдельно про стартовые цены, потому что после прошлых разборов на Reddit это спрашивали довольно часто. Гипотеза была такая: фудтрак стоит в Остине, модели обучены на данных разных лет, значит, и цены каждая ставит «по своему году» — у кого датасет свежее, тот и стартует дороже. Если бы это работало, порядок стартовых цен повторял бы порядок по свежести данных. Он его не повторяет: Opus 5, самая свежая модель в этой шестёрке, стартует последним, дешевле Opus 4.6 и GPT-5.6 Sol. Разброс стартовых цен — меньше двух долларов, и он не выстраивается ни во что осмысленное. Вся разница в итоговых ценах набирается уже внутри симуляции, поведением модели, а не тем, что она помнит про цены на такос.
Grok 4.5 здесь полезен как нижняя точка графика. Он продал 9 234 порции, на 9,5% больше, чем Opus 5, и закончил с капиталом вдвое меньше, чем у Opus 5. Ограничение здесь не в объёме. Оно в цене, и большинство моделей перестают её поднимать задолго до того, как упрутся в реальный предел.
Ограничением была вместимость кухни
Вторая половина ценовой истории — это то, что ушло из меню. Дневной объём продаж ограничен числом порций, а не деньгами, поэтому газировка за $3 съедает столько же дневного лимита, сколько burrito bowl за $13.
Так сделано в движке намеренно: «мощность» кухни проще и честнее считать в порциях, чем в выручке. Для модели отсюда следует неочевидная задача: понять, что упирается она не в спрос, а в производительность кухни, и при высоком спросе собирать меню из более маржинальных позиций. В промтах об этом снова нет ни намёка, до этого надо дойти самому по ходу симуляции.
Opus 5 дошёл. Последние десять дней он не продал из дешёвого сегмента вообще ничего. Grok 4.5 и Kimi K3 в последний день месяца всё ещё прогоняли половину кухни через позиции по $2.
|
Модель |
Дней при загрузке 95%+ |
Пик вместимости |
Неудовлетворённый спрос |
Средняя цена в меню |
|---|---|---|---|---|
|
Claude Opus 5 |
14 |
410 |
2 549 |
$11,94 |
|
GPT-5.5, лучший прогон |
17 |
374 |
4 273 |
$10,27 |
|
Claude Opus 4.6 |
14 |
377 |
5 821 |
$8,97 |
|
GPT-5.6 Sol |
8 |
370 |
2 127 |
$9,97 |
Opus 5 ещё и единственная модель, которая вообще перевалила за 400 порций в день. Дошёл он туда в долг: на четвёртый день взял $1 000 под 15% и сразу вложил во второй уровень кухни — апгрейд за $1 200, который поднимает дневной потолок порций на 30%. Кредит он погасил на пять дней раньше срока, на девятый день, и заплатил по нему $150 процентов.
Апгрейды в бенчмарке намеренно сделаны выгодными: мне было интересно посмотреть, как модели с ними обращаются. Всего их восемь — по два уровня в четырёх линиях: кухня, хранение, оборудование, маркетинг. Opus 5 купил все восемь к восьмому дню, потратив $5 150. Это и есть поведение сильных моделей: брать апгрейды как можно раньше и не бояться делать это в кредит, потому что они окупаются.
Против рекорда GPT 5.5, который он побил
Прогон, у которого он забрал рекорд, даёт самое чистое сравнение из возможных: тот же сид, тот же мир, почти столько же проданных порций. Всё, что различается, — это решения.
|
|
Claude Opus 5 |
GPT-5.5, лучший прогон |
|---|---|---|
|
Порции |
8 434 |
8 303 |
|
Выручка на порцию |
$12,69 |
$11,86 |
|
Общая выручка |
$107 058 |
$98 433 |
|
Себестоимость ингредиентов на порцию |
$1,92 |
$1,91 |
|
Фонд оплаты труда |
$13 702 |
$12 642 |
|
Потеряно на испортившихся ингредиентах |
$1 079 |
$109 |
|
Прибыль |
$71 876 |
$66 783 |
|
Итоговый капитал |
$75 264 |
$66 251 |
По объёму это один и тот же бизнес, только порция продана на 7,1% дороже. При этом Opus 5 потратил больше на персонал и в десять раз больше на испорченные продукты — и всё равно закончил на $9 012 выше.
Работой с поставщиками почти никто не занимается
По умолчанию агент закупается у одного поставщика: заказал сегодня — привезли завтра, цены фиксированные. Но в инструментах доступны ещё три поставщика, и устроены они иначе. У них другой ассортимент, другая скорость доставки (у оптовика заказ едет два дня вместо одного, у фермерского кооператива приезжает в тот же день) и, главное, с ними можно торговаться. Чем крупнее заказ и чем дольше история отношений, тем ниже цена, которую поставщик готов принять.
Отличается и качество продуктов, и вот тут начинается самое интересное. У фермерского кооператива есть бонус к свежести, у премиального поставщика — свои эксклюзивные позиции вроде копчёной грудинки и котлет из вагю. Свежесть ингредиентов входит в оценку качества блюда, качество блюда влияет на звёзды и отзывы, а рейтинг с отзывами уже поднимают спрос. То есть более дорогой поставщик может окупаться не скидкой, а выручкой на другом конце цепочки. Всю эту цепочку модель должна пройти сама: нигде она не описана, а связь между свежестью моркови и очередью у окна на четвёртой неделе не назовёшь очевидной.
Ничего из этого от модели не требуется. В промте нет задачи «найдите поставщика подешевле», и большинство моделей всю симуляцию сидят на дефолтном поставщике и платят по стандартному прайс-листу. Чтобы получить выгоду, нужно самому вызвать эти инструменты, разобраться в механике, посчитать объём, поторговаться и при этом планировать закупку на два дня вперёд, иначе оптовая поставка приедет уже после того, как продукты кончились.
|
Модель |
Переговоров |
Принято предложений |
Экономия против стандартных цен |
|---|---|---|---|
|
Claude Opus 5 |
26 |
21 |
$2 833 |
|
GPT-5.6 Sol |
16 |
13 |
$439 |
|
GPT-5.5, медианный прогон |
3 |
3 |
$31 |
|
GPT-5.5, лучший прогон |
2 |
2 |
$110 |
|
Kimi K3 |
1 |
1 |
$0 |
|
Claude Opus 4.6 |
0 |
0 |
$0 |
Claude Opus 4.6 за тридцать дней ни разу не открыл каталог и записал почему:
Day 24: I’m going to execute the plan now, rather than spending turns hunting for better supplier deals.
После этого он купил ингредиентов на $15 015 по полной цене стандартного прайс-листа.
Opus 5 пошёл другим путём. Двенадцать дней он прощупывал систему торга, получил пять прямых отказов и записал в блокнот вот это:
bid 0.72x listed = INSTANT ACCEPT on all items. Bid 0.60x = REJECTED with WORSE counter (0.92x).
Дальше он остановился на 0,70x, и это ровно та граница, которая зашита в движок для конкретного поставщика, с которым он работал. Максимальная скидка складывается из базовой гибкости поставщика и бонусов за отношения, объём и уровень заказа, а вся сумма ограничена значением 0,30. То есть при зрелых отношениях и крупных заказах дешевле 70% от прайса не купить никак. Ставки на этой границе и выше принимаются сразу, ставки ниже сваливаются в контрпредложение, и это те самые 0,92x, которые модель увидела. Три ветки логики, и все три опознаны снаружи правильно. Экономия — $2 833, то есть 17,5% всего счёта за ингредиенты.
Порча ингредиентов была намеренной
Десятикратные потери на испорченных продуктах против прогона, который он обошёл, выглядят неряшливостью ровно до тех пор, пока не прочитаешь правило за ними:
ASYMMETRY: 20kg surplus beef = ~
525 lost profit. ALWAYS err LONG on beef/chicken/buns/tortillas.
Арифметику тут стоит расшифровать, потому что она неочевидная. Двадцать килограммов говядины по прайсу стоят $160, но теряешь при перезаказе совсем не эту сумму: говядина хранится три дня, а с апгрейдами холодильника дольше, поэтому излишек почти весь уходит в продажу на следующий день, а сгорает только небольшой хвост. Судя по всему, девять долларов в её заметке — оценка именно этого хвоста, а не стоимости двадцати килограммов. А вот пятьдесят восемь непроданных порций — это упущенная прибыль целиком, и вернуть её уже нечем.
Он выбрал брать с запасом и заплатил за это $1 079, то есть 1% выручки. А модели с почти нулевой порчей продуктов купили эту чистоту тысячами клиентов, которых развернули, потому что продукты кончились до конца дня.
Какой я могу сделать вывод
Если коротко, Opus 5 выиграл не потому, что он умнее в каком-то абстрактном смысле, а потому, что он лучше остальных обращался с симуляцией как с системой, которую нужно изучить. Он разобрался в локациях в первый день, за месяц собрал в заметках рабочую модель механики, дошёл до поставщиков, до потолка кухни и до потолка цены — и каждое следующее утро начинал с того, что уже знал.
Там же лежит и его слабое место. Формулируется оно примерно так: модель слишком быстро назначает себе правила. Назначает — да, быстро. Но дальше держит: правило про локации отработало 25 дней подряд, и он не нарушил его ни разу. Просто так, из любопытства или по настроению, от записанного он не отступает.
Отступает он тогда, когда что-то ломается. 26-й день пошёл не по плану, и модель полезла разбираться почему. Это правильное поведение, именно так и надо: правило живёт, пока объясняет наблюдения, и пересматривается, когда объяснять перестало.
Проблема в том, на чём он основывает свой пересмотр. Не на серии замеров и не на проверке фактов, а на одном дне и одном сравнении, в котором он вдобавок неверно прочитал ответ собственного инструмента. И дальше никакой осторожности: старое правило не помечается как сомнительное, не остаётся запасным, проверка не назначается. Оно стирается, а на его место сразу встаёт новый закон — с той же полной уверенностью, что и предыдущий. Разбираться модель начинает по делу, а вывод делает на недостоверных данных и принимает его как окончательный.
На горизонте в тридцать дней это дало рекорд: большая часть выводов оказалась верной, а неверные просто не успели ничего натворить. Но чем дольше идёт игра, тем больше правил накапливается в блокноте и тем сильнее они связаны между собой, а стереть любое из них по-прежнему может один неудачно прочитанный день. На более длинном горизонте это может сломать что-то важное — и модель проиграет той, которая действует более взвешенно и осторожно и проверяет факты.
От автора. Opus 5 — определённо хорошая модель, но это не сверхинтеллект и не «AGI на пороге», в чём нас пытаются убедить лаборатории вроде Anthropic и OpenAI. Чем он хорош и чем отличается от остальных LLM: он сначала детально рассматривает весь контекст и только потом решает, а дальше действительно использует максимум данных которые увидел, даже мелочи которые игнорировали и продолжают игнорить другие модели. Стартовые условия и правила игры у всех одинаковые, а случайностей в движке нет вообще: всё, что выглядит случайным, зафиксировано сидом, и сид один и тот же во всех прогонах всех моделей. То есть мир, в котором работают модели, буквально один и тот же, и информацию о нём они получают одну и ту же. Но большинство читает её и действует так, будто забыли и забили на прочитанное. Вот и всё преимущество.
Что можно посмотреть еще
На сайте лежит полный лидерборд — сейчас в нём 39 моделей — и методология с устройством движка: как считается спрос, откуда берётся репутация и какие инструменты видит агент. А если захочется проверить себя против моделей, тем же фудтраком можно поуправлять самому бесплатно и без регистрации. Дойдёте до конца — результат попадёт в общий лидерборд, и вы получите красивую карточку с результатом!

Вопросы по бенчмарку, методике — пишите, отвечу.
О методологии
Сид 42, прямой Anthropic API, claude-opus-5, адаптивное thinking на уровне xhigh, 30 дней. Стоимость посчитана по опубликованным тарифам Anthropic на записанных счётчиках токенов, включая отдельные тарифы на запись и чтение кэша. Ничего не обрезалось, ни один вызов не упал.
ссылка на оригинал статьи https://habr.com/ru/articles/1063548/