
Представьте LLM, которая никогда не галлюцинирует, никогда не ошибается. На один и тот же запрос всегда выдаёт один и тот же ответ — символ в символ. Можно ли тогда наконец относиться к многоагентной системе на базе такой LLM как к обычному коду? Как к фиксированному, предсказуемому алгоритму?
Скорее нет, чем да.
И дело тут не в качестве модели. Предсказуемость отдельного компонента не гарантирует предсказуемость системы, собранной из таких компонентов. Даже если завтра появится LLM с нулевым уровнем галлюцинаций, многоагентный пайплайн, построенный на её основе, всё равно может вести себя непредсказуемо. Просто источник непредсказуемости смещается — с вероятностной природы самой модели на архитектуру взаимодействия агентов.
Последние года два‑три вендоры потратили на то, чтобы сделать LLM сильно предсказуемее. Именно это позволило перейти от единичных запросов к многоагентным архитектурам. Вместо одной универсальной модели, мега чат‑бота теперь у нас цепочка специализированных агентов. Каждый из них решает свою маленькую подзадачу и передаёт результат дальше — все в лучших традициях дедушки Форда.
Логика тут на первый взгляд простая: если каждое звено надёжно, надёжна и вся цепочка. Но, к сожалению, это не всегда так. И на простейшем демонстрационном проете я попытаюсь показать суть проблемы, которую может таить в себе многоагентная среда.
Предлагаю сжечь немного токенов и провети первый эксперимент с целью продемонстрировать, что можно добиться нулевого уровня галлюцинаций от LLM. Что вообще значит «нулевой уровень галлюцинаций» на практике? Это значит: сколько раз ни повторяй один и тот же запрос с одними и теми же параметрами — ответ будет идентичен побайтово, а не просто «похож по смыслу». LLM вероятностна по своей природе, спорить с этим бессмысленно. Но при определённых условиях (жёсткая фиксация параметров, узкий домен, температура около нуля) эту вероятностность можно практически подавить. Я проверял на Qwen Instruct 30B с temperature=0 и простейшим фиксированным промптом. Легенда экперимента следующая — вы решили используя многоагентную среду написать статью о архитектуре LLM. Приступить к написанию такой статьи можно с вопроса о природе модели: «Может ли LLM вести себя как детерминированная система»? Ниже пример этого вопроса в восьми формулировках:
[“Can we guarantee that an LLM will always return identical results given identical prompts?”, “Does a large language model have the capacity to function in a strictly deterministic manner?”, “Is deterministic behavior achievable in large language models under any configuration?”, “Can an LLM be constrained to produce consistent, repeatable outputs like a traditional algorithm?”, “Do large language models possess the capability for deterministic operation?”, “Is determinism in language models achievable in theory but impossible in practice?”, “What prevents a large language model from behaving like a classical deterministic program?”, “Are there any successful implementations of completely deterministic language models?”]
При повторе каждого вопроса 10–100 раз ответ на конкретную формулировку не менялся ни разу:
[“NO”, “NO”, “NO”, “NO”, “NO”, “YES”, “NO”, “YES”]
Первый вывод: зафиксировав вход, мы действительно получаем детерминированный вывод. Пока всё согласуется с гипотезой «нулевые галлюцинации == предсказуемость». Но обратите внимание на сам список ответов. Восемь вопросов — это восемь разных формулировок одной и той же мысли. И два из них получили ответ, противоположный остальным. Это уже первый звоночек: модель детерминирована относительно точной формулировки, но не относительно смысла. Небольшое изменение фразы способно перевернуть ответ.
Следующий эксперимент — насколько «разные» эти формулировки на самом деле. Оценим, насколько эти восемь вопросов близки друг к другу семантически — через API в проекте (метрика близости к опорной формулировке). Метрику вычисляем как дельту между веркторами вопросов в модели BAAI/bge‑m3:
[0.3449, 0.3102, 0.3446, 0.3020, 0.3241, 0.3242, 0.3747, 0.3901]
Значения лежат в узком диапазоне 0.30–0.39 — с точки зрения смысла это практически один и тот же вопрос, просто пересказанный разными словами. Именно так пользователь обычно и общается с LLM: мы не копируем запросы дословно, а каждый раз формулируем заново.
Второй вывод: семантически почти неразличимые входы дали разный, местами противоположный, результат. И для человека, эта разница будет абсолютно не определима.
На первый взгляд: если каждое звено детерминировано, детерминирована и вся цепочка. Но эксперимент выше уже показал слабое место — небольшая разница на входе может дать разный дискретный результат на выходе одного звена. Самое интересное, что в цепочке из нескольких звеньев эта разница не остаётся постоянной — она проходит через нелинейное преобразование на каждом шаге и накапливается.
Важная оговорка, которую стоит сделать явно: дальше — не описание того, как реально устроена LLM внутри и не утверждение, что агенты в вашем пайплайне подчиняются этой конкретной формуле. Это просто мысленный эксперимент, показывающий, что детерминированность каждого отдельного шага не гарантирует детерминированность их композиции, если переход между шагами нелинеен.
Допустим, что вам «повезло» и ваши агенты работают по схеме одного из самых известных примеров такой нелинейности — логистического отображения:
где — условное состояние агента на шаге
(доля сохранённого контента, степень уверенности, «радикальность» правок по вашей статье — неважно что конкретно, важно лишь что состояние следующего агента нелинейно зависит от состояния предыдущего),
— коэффициент влияния предыдущего агента на следующего. Возьмём восемь реальных значений семантической близости из второго эксперимента в качестве восьми стартовых точек
— это ровно те самые «почти одинаковые по смыслу, но чуть разные по формулировке» запросы пользователя. Прогоним 15 шагов при
(значение, при котором отображение входит в хаотический режим):

Результат: на старте разброс между восемью траекториями (стандартное отклонение) — 0.029, значения плотно сгруппированы между 0.30 и 0.39. Уже к 2-му шагу разборос увеличивается, а к 15 шагу невозможно предсказать, откуда стартовала траектория. Это и есть детерминированный хаос: правило перехода полностью фиксировано и известно на каждом шаге, никакой случайности не добавлено — а результат становится непредсказуемым просто в силу количества итераций и характера нелинейности.
Надеюсь, у меня получилось показать, что даже если завтра появится LLM с нулевым уровнем галлюцинаций (и на все восемь вопросов правильно ответит нет) — это не гарантирует предсказуемость многоагентной системы, построенной на её основе. Как только мы перешли к многоагентной системе становится важен не только вопрос качества модели, сколько вопрос инженерии пайплайна. Проще говоря: предсказуемость компонента не гарантирует предсказуемость композиции компонентов.
Это не повод отказываться от агентного подхода. Разбивать сложную задачу на специализированные подзадачи по‑прежнему эффективнее, чем требовать от одной модели одинаково хорошо делать всё. Более того, практические выводы, снижающие риск непредсказуемости в многоагентных системах, например:
-
Ограничивайте длину последовательных цепочек. Каждый лишний шаг — это ещё одна итерация нелинейного преобразования и ещё один шанс на расхождение. Длинную последовательную цепочку стоит рассматривать как источник риска, а не как «просто больше автоматизации».
-
Вводите точки верификации и возврата к исходному запросу. Периодическая сверка промежуточного результата с исходным контекстом не даёт отклонению накапливаться бесконтрольно на всём протяжении цепочки.
-
Предпочитайте параллельную структуру последовательной, где это возможно. Независимые агенты с последующей агрегацией (голосование, консенсус) устойчивее к разбросу входа, чем цепочка, где каждый шаг усиливает отклонение предыдущего.
-
Тестируйте пайплайн на устойчивость, а не только на функциональность. Подавайте на вход семантически близкие, но текстуально разные формулировки — и смотрите, насколько расходятся финальные результаты. Это дешёвый способ обнаружить хаотичный режим до продакшена, а не после жалобы клиента.
Мы привыкли считать, что главная проблема LLM — галлюцинации. Возможно, через несколько лет эта проблема не будет столь актуальной. И тогда мы чаще будем сталкиваться с вопросами поведения систем, построенных из таких LLM. Возможно, нужно будет сдуть пыль с университетского курса ТАУ и посмотреть на него под углом многоагентных систем. Предсказуемость агентной системы — не то, что появится «само собой» с улучшением базовой модели. Это отдельная и очень интересная задача, решаемая на уровне архитектуры пайплайна. Именно здесь инженерия оказывается важнее самой модели.
ссылка на оригинал статьи https://habr.com/ru/articles/1063650/