Мысли о Chain-of-Thought

от автора

Сегодня имеем лавинообразный рост статей о нарастании проблем в ИИ, таких как:

1.      нехватка энергии для дата-центров;

Сегодня имеем лавинообразный рост статей о нарастании проблем в ИИ, таких как:

1. нехватка энергии для дата-центров;

2. нехватка аппаратных средств и видеокарт, в частности;

3. нехватка удовлетворенности степенью интеллектуальности существующих ИИ-систем, а попросту говоря нехватка логики, непонимание семантики и неспособности к производству нового знания (не путать с «простой» проблемой получения обобщений на основе статистики);

4. нехватка теплоты человеческого общения на фоне засилья чат-ботов;

5. нехватка бюджетов уже просто на эксплуатацию уже внедренных ИИ-решений (на фоне все возрастающей прожорливости компаний-поставщиков ИИ-решений).

И причин этому тоже несколько:

1. Желание не тратить время на глубокий анализ проблемы и желание переложить их на другие плечи, например, на ИИ-плечи. Об этом тоже много написано под вывеской «автоматизированный бардак – все равно бардак». Надо отметить, что люди вообще не склонны быстро отказываться от своих привычек и любимых мозолей. Наши проблемы греют нам душу и поддерживают ощущение стабильности. Да, мы стремимся к новому, но чаще не в попытке отказаться от старых догм и проблем, а скорее в поисках новых, когда старые начинают немного приедаться.

2. Получить простую возможность выглядеть лучше, не затрачивая усилия, за счет использования разного рода ChatGPT и т.д.

3. Сэкономить время и получить быстрый ответ в случаях, когда или нет времени или нет причин и желания тратить на это свою энергию.

4. Действительно получить пользу в тех случаях, когда это дает реальный эффект. Например, в задачах связанных с обработкой изображений или там, где точность результата не критична, а трудозатраты на перебор больших массивов данных значительны. Например, в случае с переводом текстов, когда точность перевода не критична, где мы можем легко скорректировать результат сами, понимая контекст.

Человеческую натуру не изменишь, да и записываться в нео-луддиты попросту глупо. Отсюда вывод о неизбежности дальнейшей «чат-ботизации» мира вокруг нас. А значит, человечеству предстоит найти решения по улучшению существую технологий.

О части таких возможностей, а именно о пути по созданию гибридных систем, объединяющих я уже писал здесь.

Здесь сразу стоит сделать замечание, что разного RAG-костыли — это не эквивалент символьным методам, так-как здесь речь идет главным образом об обогащении контекстного окна за счет обращения к внешним источникам, по сути пересборки отдельных кортежей токенов за счет их обработки внешними инструментами. Например, выполнение DQ-процедур (очистки и стандартизации, проверки орфографии) или обогащения из внешних источников (за счет подтягивания карточки товара) и т.д.. Но это не реализует полноценно задачу логического вывода.

Значит, решение так или иначе лежит в области Chain-of-Thought (CoT). Но существующие сегодня решения крайне далеки от того, чтобы быть действительно цепочками рассуждений с человеческой точки зрения.

В попытках осмысления сути происходящего я недавно натолкнулся на статью «Escaping the chain-of-thought trap: What is next for LLM reasoning». В ней вопрос о создании гибридных коннекционистско-символьных систем начинает вырисовываться в новых красках. Другими словами, вопрос о сращивании возможностей нейро-сетей и систем, оперирующих правилами.

Суть статьи можно выразить фразой «Прекратите антропоморфизировать промежуточные токены как следы рассуждения!».

В частности, приведу две мысли авторов:

«Детальное исследование сложных задач планирования, таких как среда Blocksworld, показывает, что выигрыш от CoT — это хрупкий мираж за пределами узких дистрибутивов. ЦТ не может научить модель общим, повторяемым процедурам. Вместо этого он создает очень специфичное для подсказки поведение, которое вызывает серьезное накопление ошибок по мере того, как цепочки рассуждений становятся длиннее. Поскольку каждый сгенерированный токен зависит от правильности предыдущих токенов, единственное логическое отклонение в начале текстовой цепочки обрекает на провал весь путь выполнения. В некоторых задачах вне распределения принудительное создание модели CoT активно снижает ее точность по сравнению с прямыми ответами.»

и

«Длинные цепочки рассуждений увеличивают затраты на вычисления и память, заполняют ограниченное контекстное окно модели по большей части бесполезной болтовней CoT и замедляют скорость генерации следующих токенов. Принуждение модели к «мыслям вслух» ограничивает скорость вывода и приводит к огромной задержке.»

Таким образом я еще раз убеждаюсь в том, что те компании, которые первыми примутся за создание таких систем, окажутся в выигрыше. При этом, что важно, такие решения не требуют переобучать LLM-модели, не требуют огромных энергозатрат и кучи GPU.

Но требуют больших интеллектуальных затрат на создание ядер, обеспечивающих решение проблемы логики рассуждений и учитывающих семантику.

В качестве обнадеживающего момента здесь можно выделить тот факт, что это не совсем новое поле исследований.

Во-первых, есть большой массив исследований в области аналитической философии, математической логики, семантики и т.д. Этой проблеме этой уже как минимум около ста лет. Например, начать можно с работ Карнапа, работ Белнапа и Стила, продуктивного мышления Вертгеймера и еще множества других работ. Это только то, что первое пришло в голову. Есть и современные работы, такие как ДСМ-метод Виктора Константиновича Финна.

Во-вторых, имеется большой накопленный опыт в области построения экспертных систем. Да, в то время он провалился, но и отрицательный опыт — это тоже опыт. А «граблей» там было найдено множество. Да и нейронные сети, если подумать, тоже взлетели не с первого раза…

ссылка на оригинал статьи https://habr.com/ru/articles/1073108/