Пока LLM-индустрия наращивает масштабы дата-центров и обучающих датасетов, всё чаще возникает вопрос, а что дальше? Энергия, знания, деньги не бесконечны. Что будет, когда что-то из них кончится?
Топы надеются на AGI, который, внезапно появившись из тераваттов и петабайтов, решит все проблемы и ответит на все вопросы. К сожалению, есть сомнения в столь чудесном событии.
Проблема в том, что нет предпосылок, что AGI появится в текущей архитектуре. Потому что горизонт не расширяется изнутри вычислимой системы, нужен внешний источник, невыводимый из состояния. Поэтому всё чаще исследователи пытаются найти нужное направление поиска в философии.
Эта статья о том, поможет ли философия, а если нет, то кто?
Профессиональная философия
Я с огромным уважением отношусь к философии, и людям, которые ей занимаются. Но вовлеченность людей, профессионально занимающихся вопросами сознания, непосредственно в развитие ИИ проявляется только в области этики и морали. Я, честно говоря, наблюдаю в основном фантазии на тему, что сделает суперИИ с человечеством. Что же мешает очень умным людям принять участие в проблеме развития искусственного интеллекта?
Мне повезло поучаствовать в содержательной дискуссии в философском паблике Матвея Сысоева (МГУ) с кандидатом философских наук, замечательным преподавателем СПбГУ, Родионом Савиновым.
Основной мой вопрос был, есть ли точка соприкосновения философии, философских теорий с реальностью. С нашим миром железа, кода и машин.
Итог беседы:
И наивный эмпиризм, и платонизм имели пересечение с реальностью: реальностью системного мышления и объяснения его работы. Когда оказалось, что эти модели не удовлетворяют тому, как мышление работает, от них вынуждены были отказаться. На фоне этих изменений, конечно, шли и политические перевороты, и научная революция. Поэтому слово реальность в данном случае не означает нечто, что можно потрогать или взять в рот.
С другой стороны, могли ли вы это назвать «внутренним основанием»? Наверное, да, учитывая произвольность вашего словоупотребления…
Что касается сегодняшнего положения дел, то нынче, как я говорил, мы имеем целый ряд моделей (к примеру, эмпиризм, рационализм и критицизм), которые в различных версиях конкурируют друг с другом и составляют своего рода «жесткое ядро» той или иной научно-исследовательской программы. Учитывая их устойчивость, вероятно, должна поменяться радикально сама наша способность познавать, чтобы какие-то из этих моделей оказались нерелевантны. Отдельных открытий или смены одной физической или биологической теории другой тут будет явно недостаточно.
Перед нами одна из позиций внутри профессиональной философии (вполне авторитетная), изложенная достаточно ясно. Для философии реальность не то, что можно потрогать, а «реальность системного мышления», и соответствие философии этой “реальности” проверяют сами философы средствами философии.
В этом смысле философия от реальности инженеров никак не зависит, а на реальность инженеров влияет весьма опосредовано и медленно. Любые изменения в мире, смена физических теорий, открытия недостаточны для корректировки философских моделей.
Такой подход профессиональных философов объясняет, почему ждать от них помощи в построении AGI не приходится. А с точки зрения инженеров если какая-то концепция не влияет на мир, то и для мира она фактически не существует.
Тем не менее, дефицит теоретической базы, на основании которой можно было бы сформулировать гипотезы и проверить их в железе и коде, очевиден для всех.
На этом фоне появились люди, которые задались вопросами, как осознает человек, как перенести принципы сознания в код и нейросети, что значат принципы работы нейросети для бытия. Поскольку термин философия уже по сути приватизирован профессиональными философами, то для таких людей нужен новый термин, но честно говоря, лучше термина чем инженер, как тот кто проверяет идеи реальностью, я не нашёл. Эти инженеры были вынуждены начать философствовать, но философствовать в инженерной манере.
Этих людей вы наверняка видели и на Хабре, и в статьях на arXive. Да они часто ошибаются, но у них есть одно неоценимое преимущество перед профессиональными философами, они экспериментируют, они живут в нашей реальности, их ошибки двигают знания мира вперёд. Они не говорят, что моя концепция настолько глубока, что вам лучше поверить мне на слово, они пишут код и проверяют его математикой. И поэтому они существуют для мира, в этом и есть суть инженера.
Сегодня я остановлюсь на концепциях двух людей, которых я отношу к этой группе. Нейробиолог Карл Фристон и физик Виталий Ванчурин.
Карл Фристон
Карл Фристон на сегодня пожалуй самый известный нейробиолог в мире. Причем не столько среди нейробиологов, сколько среди ml-исследователей и философов сознания. Известен он в первую очередь своей концепцией свободной энергии, которая изначально касалась нейробиологии, но очень быстро была взята на вооружение исследователями нейросетей и стала предметом обсуждения философов сознания.
Принцип свободной энергии предполагает, что мозг уменьшает неожиданность или удивление (surprise), делая прогнозы на основе внутренних моделей и используя сенсорный ввод для обновления своих моделей с целью повышения точности прогнозов. В более общем виде концепция звучит так:
Система, предполагающая длительное существование, сопротивляется распаду, то есть должна удерживать себя в состоянии гомеостаза. Как для человека нормальная температура тела должна удерживаться в пределах отклонения в один градус.
Гомеостаз значит, что система чаще находится в узком наборе состояний и маловероятно в остальных. То есть это распределение с острым пиком, состояния гомеостаза система встречает как ожидаемые, остальные как неожиданные. Оценка того, насколько состояние маловероятно, и называется неожиданностью.
Если система регулярно оказывается в маловероятных для себя состояниях, гомеостаз распадается. То есть фактически Фристон описал гомеостаз через математику. Инструментом удержания гомеостаза становится уменьшение неожиданности — избегание состояний, маловероятных для самой модели.
Неожиданность напрямую посчитать нельзя, мир слишком велик. Но её можно ограничить сверху какой-то величиной. Эту величину Фристон и называет свободной энергией. Минимизируя свободную энергию, система тем самым минимизирует и неожиданность.
Уменьшить расхождение между ожиданием и миром можно двумя способами. Первый: изменить свою модель мира, скорректировав ожидания под факт (восприятие и обучение). Второй: изменить сам мир до совпадения с ожиданиями (действие). Вы ожидаете увидеть и почувствовать стакан в руке, берете стакан; предсказание сбылось. Второй способ Фристон называет активным выводом (active inference).
Именно поэтому на концепцию Фристона обратили внимание ml-исследователи. Восприятие, обучение, действие и целеполагание превратились в одну операцию — уменьшение неожиданности.
Слепые пятна модели Фристона
Обратите внимание, действие выбирается на основании предсказания, то есть предсказание попадает во вход предсказываемого. Фактически это диагональ Тьюринга. Если я предсказываю, что сейчас я возьму стакан, я могу отказаться от исполнения предсказания и тем самым оно становится ложным. Именно потому, что действие зависит от предсказания, предсказание становится частью того, что предсказывается. Это значит, что полное предсказание невозможно, просто в силу структуры предсказания.
Из этого следует, что у агента всегда присутствует разрыв, структурный нижний предел ошибки самопредсказания, который не зависит от масштабов модели. Источник ошибки предсказания в том, что система предсказывает себя предсказывающей. И этот разрыв в структуре неустраним.
Популярная критика принципа свободной энергии заключается в том, что агент, последовательно минимизирующий неожиданность, должен забраться в тёмную, максимально предсказуемую комнату, и там остаться.
На критику отвечают тем, что минимизируется не текущая, а ожидаемая свободная энергия, и в её структуре появляется элемент (эпистемический член), стимулирующий исследование и, что он возникает математически при выводе на протяжённых последовательностях. Хотя выглядит, конечно это как костыль, ручное добавление “любопытства”.
Между тем, я полагаю, что здесь проблемы нет. В тёмной комнате мир предсказуем, но агент сам для себя является источником расхождения, потому что обнулить его не может. То есть коллапса темной комнаты нет, потому что это структурное свойство петли. Агент может уйти от мира, но от себя уйти не может.
И нюанс, эпистемический член не добавляется вручную, но функцию любопытства он на самом деле не исполняет, в модели Фристона направление движения задают приоры предпочтений, ожидаемая польза считается по текущей модели. Агент движется туда, где по его различениям выигрыш максимален, но перестроить собственные различения не в состоянии.
Минимизация в принципе требует только уменьшения неожиданности. Направление у модели появляется отдельно, через ценность, через приоры предпочтений, и вот это и есть то, что для системы задается снаружи.
И тогда нужно менять понимание концепции Фристона. Агентность появляется не из минимизации свободной энергии, а для агента с уже заданными предпочтениями свободная энергия описывает механизм его движения. Происхождение предпочтений (агентности в классическом его определении) концепция не описывает.
И встроить источник предпочтений внутрь системы невозможно. Минимизация определена относительно ожидаемого, а ожидания задают приоры. Без приоров сравнивать просто не с чем. Если же минимизация будет формировать приоры, то тогда по сути минимизация замкнется на себя.
Откуда появляются приоры. Имеющиеся приоры уточняются в процессе работы системы и это общепринятый вариант (вытекает из концепции предсказания и сравнения с фактом, Гельмгольц, Рао и Баллард, Анохин с акцептором результата действия и Бернштейн с моделью потребного будущего).
Базовые приоры возникают эволюционно, отбор работает через выбраковку агентов средой. То есть вопрос с источником кажется закрытым.
Но объяснений Фристона в применении к человеку не хватает.
Подавляющее число предпочтений человека не эволюционные и не личная конструкция. Эти предпочтения переданы обществом. Ребёнок формирует приоры не на потоке ошибок предсказания, а усваивает готовые различения: слова, указания, названия безо всякой проверки.
Тут эффективнее концепция Выготского. Сначала социум проводит различение, потом его воспринимает ребенок. Ребёнок не рождает слово сам, сколько бы ни минимизировал. Точно так же настраивается и доверие, чему верить, что игнорировать, что учить — это установки общества.
Карл Фристон строит агента и сознание через минимизацию свободной энергии, но вынужден задать извне приоры, определяющие, что для системы нормально.
Но есть разница между постулатом-ограничением и постулатом-содержанием. Ограничение — это запрет, из которого следует остальное (запрет на превышение скорости света), а вот второе, уже установленная цель, акт демиурга, указывающий чему быть. Ограничение не решает за мир, тогда как цель уже и есть решение. И установленная кем-то цель для системы, это отказ в её агентности. А в случае Фристона, если цель не выведена и не может быть выведена изнутри, значит система движется к тому, чего не выбирала.
Виталий Ванчурин
Физик-теоретик, работающий над оригинальной концепцией “Мир как нейронная сеть”. Мне повезло недавно присутствовать на его онлайн-докладе и задать несколько интересных для меня вопросов. Так что ниже текст, основанный не только на его текстах, но и непосредственно на его ответах, как я их понял.
Виталий по сути это Фристон на максималках, он переносит базовый механизм минимизации на масштабы вселенной. Ванчурин, как настоящий ученый, осторожен. Он формулирует не “мир является обучающейся системой”, а “мир может быть успешно смоделирован как обучающаяся система”. В работе он опирается на информационную физику Уилера, энтропийную гравитацию Джекобсона и Верлинде, стохастическую динамику Нельсона, геометрическое обучение Амари. При этом отказывается от квантового постулата, полей, гравитационного постулата, пространства-времени.
Модель Ванчурина регулируется двумя параметрами:
-
Сколько шагов входит в целевую функцию — один даёт градиентный спуск, два дают инерцию и геодезические. По сути это глубина памяти.
-
Сколько величин агенту недоступно и заменено. Например, если вы не знаете количество молекул газа в объеме, вы можете использовать показатель давления. То есть, из нехватки информации агент выводит физический принцип, и физика возникает именно из-за ограниченности агента, а не зашита в структуру мира. Каждая замена добавляет в уравнение свой элемент: калибровочную силу, тепловую, квантовую фазу.
То есть два дискретных параметра, из которых получается всё разнообразие мира.
В презентации Виталий демонстрирует вывод времени, метрики, инерции, сил, термодинамики, квантовости, электромагнетизма, спиноров, массы, гравитации.
Посмотрим теперь на что он был вынужден опираться.
Что постулировано в модели.
Глобальная целевая функция, она появляется в самом начале доклада и дальше не обсуждается, источник целевой функции не указан. Ванчурин честно говорит, что есть вещи, которые вынужденно постулируются, и ни одна теория без постулатов не обходится.
Гиперпараметры. Шаг и скорость обучения создают массу, шаг и температура градиентного шума — постоянную Планка. В реальном ml гиперпараметры настраивает инженер. Кто фиксирует их для вселенной Виталия, и что удерживает их постоянными, в докладе не сказано. Хотя постоянство фундаментальных констант проверено с высокой точностью. Постулированы равновесие (быстрые переменные успевают уравновеситься, без этого конструкция не работает) и размерность (четырехмерность взята из спинорного разложения). Уравнения Эйнштейна и Максвелла отобраны по симметриям: локальность, произвольность разметки ячеек, калибровочная инвариантность, дальше стандартная логика по числу производных. Любая другая теория, опирающаяся на эти требования, выведет то же самое.
Всё это Виталий видит и честно об этом говорит, но пропускает целевую функцию. То есть отсутствует то, для чего вся оптимизация происходит. Похоже, что для Ванчурина целевая функция не постулат, а условие постановки задачи.
Вынужденный отказ от самореференции
Агент у Ванчурина отделен от оптимизируемого блока, то есть себя он не моделирует. На прямой вопрос об этом автор ответил, что самооптимизации нет, так как есть граница.
Отмечу, что неполнота Гёделя и проблема останова Тьюринга применимы к системе, которая описывает себя и чьё описание входит в собственное функционирование. Отграничив агента, Виталий фактически делает неприменимыми и Геделя и Тьюринга в своей модели. Это снимает ряд парадоксов, но делает модель полностью детерминированной, что впрочем автор не считает недостатком. Если предсказание системы не входит в её же вход, то внешний наблюдатель просчитывает её целиком, недетерминированность обуславливалась петлёй, но петли нет. Если агент не описывает себя, его незнание это недостаток вычисления, а не свойство структуры. Поэтому Ванчурин для своей модели отрицает свободу, трактует квантовую неопределённость как неполноту описания, и фактически постулирует бесконечное обучение без соответствующего основания.
Самонаблюдение отсутствует, измерение объявлено уточнением огрублённого описания при поступлении новой информации, но чьё это огрубление и есть ли оно в переменных, не проговорено. Если есть, значит наблюдатель внутри и самореференция возвращается. Если нет, огрубление происходит вне физики.
Самообучение без самомодели фактически и есть оптимизация. Модель изменяет параметры, но что оптимизировать остается неизменным. Если целевая функция фиксирована, существует минимум, в котором движение прекращается. Структурный остаток самопредсказания мог бы решить проблему, но от этого механизма автор отказался.
Хотя есть нюанс, в его схеме агенты это обучаемые переменные, а ячейки — необучаемые. То есть состояние агента всё-таки находится в том, что оптимизируется, и агент оказывается внутри задачи. Возможно, конечно, что я не совсем понял позиции Ванчурина во время доклада.
Итог
В итоге, я пока не вижу, что концепция самообучающейся вселенной в её текущем состоянии производит новые различия в мире. Все результаты пока переобъяснение текущей физики. Вполне вероятно потому, что настройка гиперпараметров проведена под текущую физику.
У Виталия есть заявка на объяснение космологической постоянной числом проинтегрированных масштабов. Но пока его концепция не проходит тест на влияние на реальность. Независимо от того, допустим ли мы её верность или неверность, физика мира не меняется.
И Фристон и Ванчурин сходятся в одном, система движется, пока уменьшает расхождение между ожидаемым и происходящим. Но ожидаемое кто-то задал. У Фристона это приоры, у Ванчурина целевая функция, то есть они пришли извне системы.
Обе концепции не отвечают на вопрос как формируется цель системы. Фристон выносит его в филогенез, Ванчурин задаёт функционал до начала.
Заключение
Обе концепции плодотворны и перспективны, и их слабые места это по сути продолжение их достоинств. Проблема в том, что цель из вычислимой системы не выводится, и вот это философская работа, которую пока никто не делает. Эту проблему должны помогать решать философы, помогать не кантовскими императивами, а вполне приземленными операционализируемыми механизмами.
Но пока нам отвечает Родион Савинов:
Однако, повторю, что философия не дублирует естественные науки, она занимается изучением интеллектуальных предпосылок в том числе и научного мышления.
Так что приходится инженерам справляться самим. Вопросы же непосредственно философам часто натыкаются на нежелание каким-то образом приземлять свои концепции. И есть распространенная проблема, удостоверился на собственном опыте, профессиональные философы с предубеждением относятся к людям, не имеющим соответствующего диплома, и ревностно охраняют свой храм от посторонних.
Философия нужна ИИ именно там, где заканчивается инженерное описание. Но это не означает, что философия должна оставаться разговором о предельных основаниях, не имеющих процедуры проверки.
Если философия претендует на объяснение сознания, агентности или происхождения целей, следует логичный инженерный вопрос: какое различие она должна породить в машине?
Если ответ есть — его можно реализовать, проверить, доработать концепцию и повторить цикл. Если концепция отказывается от проверки, это не гипотеза, а красивая картинка для собственного удовлетворения.
Возможно, именно здесь и должна появиться философия эры ИИ: не философия, которая объясняет инженерам, как правильно думать, а философия, которая готова позволить реальности изменить собственные основания.
ссылка на оригинал статьи https://habr.com/ru/articles/1071316/