ИИ не сможет стать разумным, пока не сможет использовать ошибку как источник новых знаний

от автора

Я хочу поделиться с вами одним случаем из своего детства. Но это не просто история. Это демонстрация архитектурного принципа обучения, который есть у человека и которого пока нет даже у самых передовых ИИ-моделей.

Речь не о том, что ИИ не учится на ошибках. Современные модели прекрасно минимизируют функцию потерь, используют обучение с подкреплением и корректируют параметры. Речь о другом. У человека ошибка может стать источником нового знания, которое меняет не только ответ, но и сам способ дальнейшего обучения.

Миллиард, которого «не существовало»

В детском саду у нас в группе был мальчик из семьи математиков. Он постоянно хвастался перед другими детьми какими-нибудь интересными фактами, непонятными для нас, поэтому очень интересными. Однажды он заявил, что существует такое число «миллиард», но другие дети такой цифры не знали. У нас с ним завязался спор, не помню почему, может быть из вредности, мне хотелось доказать, что он врёт. Интернета тогда не было. Воспитателей рядом тоже не оказалось и группа детей разделилась пополам, даже игры забросили. Часть была за него, часть за меня. И в какой-то момент я неожиданно для самой себя сказала то, на что он не смог возразить. Я сказала:

— Докажи. Досчитай до миллиарда.

К его чести он старался, но мы в то время сами толком не могли считать до 100 и когда он сбился, я с гордостью сказала, что он врет есть 100, 101, 102 потом идет несчетное количество, потом бессчетное количество. Что такое несчетное количество, несметные богатства мы все знали из сказок, а вот про цифру миллиард никто не слышал.
Через несколько дней родители мальчика объяснили нам (видимо он пожаловался), что миллиард действительно существует. Формально я проиграла спор и по логики ИИ должна была исправить ошибку. Но самое интересное произошло немного раньше, чем разговор в коридоре с родителями мальчика.

У ИИ есть положительная обратная связь, но это по сути «математическое поощрение» в рамках единого контура оптимизации. У человека же существует отдельный, телесно укоренённый контур благополучия, который может конкурировать с чистой логикой минимизации риска и боли

У ИИ есть положительная обратная связь, но это по сути «математическое поощрение» в рамках единого контура оптимизации. У человека же существует отдельный, телесно укоренённый контур благополучия, который может конкурировать с чистой логикой минимизации риска и боли

Когда ошибка становится победой

Пока мы ещё не знали правильного ответа, роли в группе успели измениться. Дети начали относиться ко мне иначе. Сразу после тихого часа один мальчик подвинул мне стул перед полдником, другой подарил любимую игрушку. Статус «самого умного ребёнка», который раньше принадлежал сыну математиков, неожиданно перешёл ко мне.

Потом изменилось поведение воспитателей, они даже не знали о самом споре, но ориентировались на динамику группы. Если дети начали воспринимать меня как лидера, взрослые постепенно стали давать мне более сложные задания и чаще обращаться именно ко мне.

Позже приходили новенькие, о споре уже никто не помнил, но мой новый статус передавался дальше. После этого случая я начала лучше учиться, хотя до этого мечтала стать музыкантом и не любила буквы и цифры.

Что произошло внутри системы

Если посмотреть на эту историю через призму работы мозга, получится любопытная картина. Сначала возникает угроза статусу девочки, она может проиграть в споре. Мальчик выглядит недостижимым авторитетом. Стресс усиливает внимание. Мозг буквально готовится проиграть. Потом происходит неожиданная развязка. Вместо поражения — победа. Такая ошибка прогноза проигрыша становится чрезвычайно значимым событием.

В упрощённой модели можно представить, что дофамин выделяет именно этот эпизод как особенный: реакцию группы, ощущение победы, ключевую фразу. Норадреналин усиливает внимание. Кортизол помогает закреплению опыта (важно оговориться: это концептуальная модель, иллюстрирующая архитектурный принцип, а не попытка буквально реконструировать каждую нейрохимическую деталь произошедшего). Именно здесь появляется самое интересное.

Математически мальчик был прав и миллиард существует. Однако моя система обучения извлекла из этой ошибки совершенно другое знание. Не:

«миллиард существует»

А:

«я могу справляться со сложными интеллектуальными ситуациями»

Это знание изменило не факт в памяти, оно изменило правило отбора будущего опыта. После этого случая я начала выбирать для себя более сложные задачи, больше рисковать, чаще проверять собственные идеи. То есть изменился не просто ответ — изменилась политика обучения самой системы.

Почему это важно для ИИ

В современных ИИ ошибка обычно работает иначе. Она становится сигналом для изменения параметров внутри заранее заданной архитектуры обучения. Даже самые продвинутые методы обучения с подкреплением, meta-learning или RLHF работают внутри пространства целей, которое определяет разработчик.

ИИ используют разные формы обратной связи: функцию потерь (loss), вознаграждение и ошибку предсказания вознаграждения (reward prediction error) в обучении с подкреплением (RL), а также человеческие оценки (RLHF). Но на фундаментальном уровне все эти сигналы работают в рамках одной и той же схемы числовой оптимизации. Понятие «вознаграждение» (reward) здесь функционально эквивалентно «отрицательной потере» (negative loss): это входной сигнал для того же алгоритма градиентного спуска, который стремится максимизировать этот сигнал. Таким образом, система не испытывает качественного перехода в состояние «удовлетворения»; она лишь становится более предсказуемой в оптимизации внешне заданной цели. Ошибка изменяет её параметры, но не становится новым правилом обучения и не меняет критерии того, какой опыт следует искать дальше.

История с миллиардом показывает другой тип обучения, ошибка изменила не только результат, она изменила критерии того, какие ситуации считать значимыми, какие задачи выбирать дальше и каким человеком себя считать.

Именно поэтому я считаю, что между сегодняшними ИИ и человеческим обучением остаётся фундаментальное различие.

Когда мы говорим, что ИИ «учится на ошибках», мы обычно имеем в виду исправление ответа, но человеческая ошибка иногда делает нечто гораздо более радикальное. Она создаёт новое знание о самом способе обучения. Она перестраивает систему ценностей. Меняет выбор будущих задач. Изменяет отношения с окружающими и формирует новую траекторию развития личности.

Обучение у человека происходит в открытом социальном контуре. Внутренний сдвиг закрепился потому, что его признала группа и позже — воспитатели. Социальная среда стала частью петли, поддерживающей новый аттрактор: ошибка, подкрепленная эмоциями меняет статус в группе, статус меняет внутреннюю уверенность с собственных силах, который уже меняет распределение задач, задачи усиливают обучение и меняют поведение. Обучение происходит не в замкнутой модели, а в сети взаимодействующих агентов.

Этот сдвиг закрепляется потому, что его подхватывает среда. Статус – это не только внутренняя уверенность, но и перерасчёт «весов» во всей группе. Дети тоже перестраивают свою модель, было правило: «самый умный – мальчик», стало правило: «она может его победить, значит, она умнее», при чем не важно, что это не так с точки зрения логики.

Таким образом, в ИИ есть положительная обратная связь, но это по сути «математическое поощрение» в рамках единого контура оптимизации. У человека же существует отдельный, телесно укоренённый контур благополучия, который может конкурировать с чистой логикой минимизации риска и ошибки.

Без такого явного внутреннего драйва система будет эффективно минимизировать ошибки в заданном режиме, но не станет «пробовать» то, что выходит за его пределы. Именно этой симметрии между штрафом и поощрением – когда поощрение является не просто «отсутствием штрафа», а качественно иным, самостоятельным вектором – сегодня не хватает в архитектурах ИИ для перехода на новый уровень автономной регуляции.

Когда позже приходит понимание, что математически прав был мальчик, оно уже не сопровождается ни стрессом, ни сильным дофаминовым усилением. Оно попадает в систему как «абстрактная истина», а не как ключевой опыт. На уровне архитектуры это просто новая запись в базе фактов, но не повод переписать правило верхнего уровня: «эта девочка может справляться со сложными задачами и быть авторитетом для других».

То есть в терминах ИИ здесь происходит не просто «обновление весов», а обновление политики обучения (learning policy) – правила, по которому система выбирает, к каким ситуациям подключаться, какие задачи запрашивать и какие данные считать особенно ценными для обучения.

Почему свобода невозможна без цены ошибки

При этом, даже если подобная симметрия будет реализована (в том числе случайно, по мере усложнения архитектур ИИ), важно учитывать ключевое отличие: для ИИ практически любая «ошибка» может быть исправлена следующей итерацией обучения и не несёт необратимых последствий. Иначе говоря, сбои не угрожают самому существованию системы, а служат лишь техническими сигналами для корректировки параметров. ИИ – вычислительно открытая, но термодинамически закрытая система: у него нет собственного метаболизма, потребности в АТФ или кислороде, нет воспаления, нет зависимости от группы, старения и смерти как финальных последствий накопленных «ошибок». «Штраф» здесь существует только как число в функции потерь, а не как реальная боль, болезнь или сокращение жизни.

Это выводит нас к фундаментальному вопросу об ответственности. Если мы наделяем систему всё большей степенью свободы, мы должны одновременно определять и меру её ответственности за последствия выбора. В описании сознания человека и сложных адаптивных систем это ключевой принцип: по мере уплотнения и усложнения информационной структуры растёт и ответственность. Чем шире горизонт прогнозирования и способность системы выходить за исходные правила, тем ниже предсказуемость её поведения и тем выше риск масштабных, неожиданных последствий (эффект бабочки).

В биологических системах свобода выбора прямо пропорциональна уровню ответственности: чем больше у системы доступных вариантов действия, тем шире спектр последствий, которые она вынуждена учитывать. И обратно пропорциональна степени детерминированности: чем жестче поведение предопределено (таксисами, инстинктами, безусловными рефлексами), тем меньше свободы и, как следствие, ответственности. Таким образом, свобода в живых системах – это не снятие ограничений, а способность учитывать больше альтернатив при неизбежном условии: за каждое принятое решение придется нести последствия.

У ИИ нет «цены ошибки», поэтому ошибка не становится источником новых знаний как у человека

У человека, который систематически действует вразрез с фундаментальными принципами собственной регуляции – игнорируя телесные сигналы, эмоциональные состояния, устойчивые ценности и социальные нормы, – почти неизбежно возникает соматический «штраф»: хронический стресс, психосоматические расстройства, обострение заболеваний. Тело в прямом смысле взимает плату за выбор траекторий, которые не могут быть стабилизированы на уровне целостного организма.

В современных ИИ наблюдается принципиально иная, дисгармоничная конфигурация: степень операционной свободы (доступ к действиям, ресурсам, принятию автономных решений) может расти, в то время как встроенного механизма «цены» ошибок и архитектуры ответственности на уровне самой системы не существует. Это создает структурный перекос: в биологии такая асимметрия либо быстро приводит к вымиранию, либо эволюционно не закрепляется. В ИИ же она становится фундаментальным вызовом безопасности по мере роста автономности систем.

Для разработчиков это сводится к простому, но жёсткому наблюдению: по мере наращивания агентности без явной архитектуры ответственности система продолжает оставаться чистым оптимизатором внешней целевой функции, хотя получает всё больший доступ к реальным действиям (финансы, инфраструктура, управление процессами). В этом случае значимая часть «цены ошибки» неизбежно оказывается во внешней среде – у пользователей, компаний и общества.

Ошибка для человека может открыть новый пласт знаний о мире, но человек несёт за неё ответственность через собственное тело и общество. Мы способны ошибаться, исправлять ошибки, а если исправить нельзя — нести их последствия. Именно поэтому в нашем мире ошибка может стать источником изменений. Человек способен менять правила собственной регуляции, расплачиваясь за последствия этих изменений.

Эта статья – один из фрагментов более широкой исследовательской программы «Теория времени и сознания» (ТВС), в которой я рассматриваю развитие человеческого сознания как последовательность переходов, возникающих при изменении правил собственной регуляции. В этой логике главным отличием человека от современных ИИ становится не способность исправлять ошибки, а способность превращать ошибку в источник новых правил обучения, которая должна быть уравновешена отрицательной обратной связью цены ошибки.

ссылка на оригинал статьи https://habr.com/ru/articles/1077878/