Как научить ИИ-агента ошибаться реже: мой опыт работы с Codex внутри Buildin.ai

от автора

Привет, Хабр.

Уже несколько дней я использую ИИ-агента Codex в своей SMM-системе как участника команды, которому поручаю дела, связанные с работой над планами и контентом.

В этой статье я делюсь своим опытом взаимодействия, показываю конкретные ошибки, которые начали возникать буквально сразу, и решения, помогавшие снизить вероятность их повторения.

SMM-система — не коробочный продукт, а рабочая среда из баз данных и страниц, созданных на платформе Buildin.ai. Это важно, поскольку такая структура определяет возможности платформы и агента в роли исполнителя.

Подключая агента, я хотел:

  • сделать возможным доступ ИИ к данным моей системы: идеи, планы, проекты, публикации, бизнес-требования бренда и т. п.

  • получить помощника для генерации релевантного контента, которому не нужно писать большие промпты, чтобы создавать нужные материалы.

Codex я подключил, используя встроенный в Buildin MCP. Первые результаты его работы вызвали у меня бешеный восторг:

  • он видел рабочее пространство;

  • понимал структуру и назначение баз данных;

  • действовал, создавая новые карточки с контентом (тексты и графика);

  • заполнял свойства связанных баз данных.

Это выглядит как чудо, так как то, на что могло бы уйти около дня, было сделано за 17 минут. Своими впечатлениями на этот счет я уже поделился в другой статье. Здесь же мне хочется описать проблемы и способы их решения.

Как я взаимодействую с агентом

Структура взаимодействия такая:

  • я ставлю задачи;

  • Buildin.ai хранит контекст и структуру данных;

  • Codex выполняет задачи и фиксирует результат.

Коммуникация между нами — в двух режимах:

  • по запросу

  • по расписанию

Если мне нужно немедленно включить его в работу, я ставлю задачу непосредственно в интерфейсе Codex. Сейчас в Buildin.ai еще нельзя указать агента через свойство типа Person или упомянуть его с помощью @ в нужном блоке данных.

Вот пример одной из таких задач:

Если срочности нет, я ставлю задачи внутри системы. Для этого предусмотрено несколько вариантов:

  • внутри контент-тикетов — карточек в базе «Контент», в которых идет работа над материалами

  • в локальной базе задач внутри тикета

  • в виде to-do в карточке тикета и внутри локальной задачи

  • в отчетных записях в базе «Журнал»

Но такой подход создал проблему, которую пришлось решать по мере накопления опыта взаимодействия.

Базу «Журнал» я добавил специально, чтобы иметь одно окно и хронологию всех конструктивных изменений. В противном случае приходится работать в двух средах и помнить, какие запросы где были:

  • в интерфейсе Codex, где создаются продукты и новые контексты

  • в SMM-системе, где находится управляемый рабочий контур.

При этом я заметил, что каждый раз, когда складывается ситуация, требующая выработки системного правила, агент сам его формулирует и самостоятельно обновляет свою память.

Если же новое правило инициирую я, его достаточно обозначить в диалоге. Агент тут же обновит системную память и запишет правило как обязательное требование.

каждый раз, когда ты выполняешь работу и у нее есть заметный результат, ты создаешь запись в журнал и фиксируешь все важное, что я должен знать об этом результате

Что агент делает для меня сейчас?

Пожалуй, это самое интересное, поскольку здесь заключается основная ценность, ради которой я готов оплачивать подписку и кредиты OpenAI.

Расставлю его работу по приоритету:

  • Агент выполняет значительную часть производственного контура: создает рабочую карточку, готовит контент, заполняет данные и передает результат на проверку.

    • создает новый тикет процесса в базе

    • заполняет все важные свойства и связи

    • генерирует контент: идеи, сценарии, тексты, графику

    • фиксирует результат проделанной работы

  • Раз в два часа проверяет систему на новые задачи

    • немедленно приступает к работе по ним

    • может отклонить, если в задаче есть противоречия (недопустимые условия)

  • Создает для меня контент и делает это системно (отталкивается от зафиксированных референсов)

    • создает сценарии: видео, Reels, карусели

    • пишет тексты

    • генерирует изображения

  • Решает системные задачи

    • может изменить конфигурацию баз данных

    • переименовать свойства

    • вставить иконки там, где это требуется

Где агент стал ошибаться

Он начинает ошибаться буквально сразу, потому что не знает, как именно ему нужно действовать и каковы критерии успеха. Он робот — машина, которая работает и мыслит совсем не так, как человек.

Ему неочевидны:

  • критерии успеха

  • приоритеты, если нужно между чем-то выбирать

  • что является задачей

  • стиль, в котором нужно производить контент и т.п.

По большому счету, все ошибки, с которыми я уже столкнулся, говорили об одном: агент просто не знает, как ему это делать. Поскольку условия не были прописаны, он действовал на свое усмотрение.

Пройдусь по конкретным ошибкам и приведу скриншоты, чтобы вы увидели, как я указываю агенту на ошибку и как он реагирует, внося изменения в свою память:

1. Не всегда заполнял все важные свойства базы

Ошибка: агент пропустил важные связи, не считая их обязательными Причина: агент не знал, какие свойства базы «Контент» являются обязательными Решение: зафиксировать, какие свойства базы являются обязательными для заполнения

2. Иногда не записывал результат в Журнал

Ошибка: агент создал контент-сетку на август, но не зафиксировал результат в Журнале Причина: агент ошибочно считал создание плановой структуры промежуточной операцией, а правило записи в Журнал применял только к готовому контенту и файлам. Решение: сделать отчет обязательным завершением значимой работы

3. Создавал дизайн разного стиля

Ошибка: агент генерировал изображения в произвольных стилях Причина: критерием успеха считалась сама генерация контента без уточнения требований к качеству Решение: в задачах генерации заказного контента ****прикреплять референсы

4. Не замечал задачи в теле карточек

Ошибка: агент не знал, где именно искать новые задачи и что считать задачей Причина: задачи ставились в разных местах и в разной форме Решение: использовать мастер-базу задач

Что уменьшает число ошибок

На этапе настройки взаимодействия, когда вы еще изучаете друг друга, важно проговаривать с агентом результаты его работы. Важно не только то, что он сделал неправильно, но и то, что он сделал хорошо. Такие фиксации быстро сформируют взаимное понимание и критерии успеха.

Мои инсайты:

  1. Нужен один источник истины.

    1. что фиксируется в базах данных

    2. что фиксируется в теле страницы

    3. как и в каком формате ставятся задачи

    4. где задачи находятся

    5. какие свойства базы обязательны для заполнения

    6. как заполнять свойства-связи, чтобы не создавать дубликатов

  2. Важны четкие критерии успеха. Агент должен знать, что именно, в каком объеме, качестве и стиле ему нужно сделать. Он также должен понимать, какие свойства баз данных необходимо заполнить и т. п. Нужно исключить разночтения и сформировать четкие правила по чувствительным вопросам.

  3. Нужна проверка результата. Важно создать правила, чтобы агент проверял результат своей работы на предмет ошибок. Например, размещаемый в теле карточки файл мог не сохраниться — это нужно проверять.

  4. Версионирование вариантов. Новый вариант контента лучше создавать рядом с исходником и связывать с ним. Не удалять черновик и не перезаписывать то, что может понадобиться для сравнения.

  5. Референсы лучше красивых слов. В вопросах стиля агент не понимает эмоций. Это вопрос не вкуса и культуры, а правил, которые лучше показать на примере, чтобы агент мог ему подражать.

С появлением агента рабочий алгоритм изменился

До появления агента я не ставил задач как таковых, а лишь планировал контент по формату, темам и времени. Агент создал контур сотрудничества, в котором я начал полагаться на него и поручать ему часть своих задач. В целом процесс теперь такой:

  1. задачи создаются в мастер-базе, а срочные поручения в интерфейсе Codex;

  2. агент открывает задачу, связанный с ней контент и изучает контекст;

  3. выполняет работу;

  4. создает или обновляет запись в Журнале;

  5. связывает ее с задачей и контентом;

  6. перепроверяет полученный результат;

  7. я принимаю работу или создаю связанную задачу на внесение правок и исправлений.

Что я планирую дальше

Следующий большой шаг — верифицировать удачные продукты и превратить их в библиотеку референсов.

Сейчас я точно понимаю, что в моей библиотеке файлов и в шаблоне нового проекта не хватает папки, куда будут складываться не просто файлы одного типа, а материалы, выполняющие функцию контекста.

По мере того как развивается сама платформа, будут меняться и алгоритмы взаимодействия. К слову, сейчас агент еще не может читать файлы и помещать их во внутреннее файловое хранилище (пример на скриншоте выше).

Как я упоминал в предыдущей статье, значительным шагом вперед станет подключение не только Codex, но и других агентов. Скорее всего, каждый из них будет эффективнее в определенной деятельности: кто-то лучше пишет, кто-то лучше формирует смыслы, кто-то лучше генерирует изображения. Вместе они составят команду, для которой SMM-система внутри Buildin станет рабочей средой, а человек будет выполнять главные — системообразующую и контролирующую — функции.

Надеюсь, мой опыт и приведенные примеры оказались полезными.

Спасибо, что дочитали. Буду рад узнать о вашем опыте работы с ИИ-агентами и ответить на вопросы в комментариях.

ссылка на оригинал статьи https://habr.com/ru/articles/1062486/