Счастлив тот, кто смог познать причины вещей

от автора

В последнее время на стыке LLM и математики происходит много всего интересного и даже скандального. Что делать математикам с этой LLM-лавиной? Погребёт ли она математику или изменит её так, что и представить сложно?

@avshkol перевел этот пост от 13 сентября 2026 года математика Нестора Гильена, опубликованный в блоге Теренса Тао. Математика и программирование первыми столкнулись с напором LLM, и этот опыт будет полезен и в других отраслях и сферах деятельности, если завтра LLM и корпорации, которые их создают, устроят и в них «ИИ-революцию».

Да, и прочитайте на эту тему на Хабре перевод тезисов доклада самого Теренса Тао: Математика в эпоху ИИ: публичная лекция Теренса Тао на Международном конгрессе математиков 24 июля 2026

Счастлив тот, кто смог познать причины вещей

Happy, those able to know the causes of things

13 сентября 2026 г. в гостевом блоге, math.GM | Теги: ИИ, Нестор Гильен | Теренс Тао

[Это гостевой пост Нестора Гильена, опубликованный здесь (в блоге Теренса Тао) из его блога. Изначально этот пост был написан в другом формате файлов и преобразован с помощью ИИ. — Теренс Тао.]

Ключевые слова: большие языковые модели, культурные технологии, скейтбординг, творческие сообщества, индустрия ИИ.

Несколько слов о времени написания этого эссе. Я начал работу над ним в разгар Международного конгресса математиков, и потребовалось некоторое время, чтобы его закончить (см. также мой более короткий пост в августе). Как бы то ни было, основная часть эссе была написана в августе и отдана для написания отзыва нескольким близким друзьям. Ранее на этой неделе Тристан Бакмастер объявил о прорывном результате, полученном совместно с Левентом Алпёге: они доказали возможность взрыва за конечное время для трёхмерных несжимаемых уравнений Эйлера с вынуждающей силой. Он также выдвинул серьезные обвинения в неправомерных действиях со стороны OpenAI. На следующий день OpenAI объявила о получении результата, касающегося взрыва за конечное время для трёхмерных уравнений Навье-Стокса с вынуждающей силой, который был выдан их внутренней LLM. Это событие широко освещалось в прессе, рекомендую ознакомиться с репортажем Кеннета Чанга. Я решил не менять начало эссе, а вместо этого сделать примечание об этой новости. В конструкции доказательства взрыва Тристан отдал должное идеям Кордовы и Мартинес-Сороа; на мой взгляд, эта важная деталь служит весомым подтверждением той точки зрения на LLM, которую я отстаиваю в этом эссе, и стала еще одной причиной оставить содержание текста практически без изменений.

Что, если бы однажды мы проснулись и услышали новость о том, что выдача LLM содержат окончательный ответ на вопрос о взрыве для несжимаемых уравнений Навье-Стокса, а также на вопрос о расположении нулей дзета-функции Римана? (Или, если коснуться задач, которые особенно дороги моему сердцу: доказательство нелокальной версии принципа максимума ABP или доказательство гипотез Малера или Комлоша?)

Многие мои коллеги-математики считают это кошмарным сценарием, и, я полагаю, это вполне обоснованная позиция. Однако здесь я хотел бы привести иной аргумент. Лично я пришел к убеждению, что новость о том, что большая языковая модель выдала интересную, глубокую и оригинальную математическую идею, может и должна восприниматься как повод для общей гордости за математику и математиков. Я также верю, что возможен мир, в котором LLM не вредят, а наоборот, помогают математикам в исполнении нашей главной задачи: постижения сути вещей.

В этом эссе я намерен подробнее раскрыть, что именно я имею в виду. Я считаю, что такой взгляд способен развеять страхи, которые многие из нас испытывают на фоне ежедневной шумихи и апокалиптических нарративов вокруг ИИ и мнимой грядущей ненужности математиков. Здесь я не буду касаться менее экзистенциальных / философских, но более практических / материальных проблем, таких как трудности с финансированием математической профессии, будущее научных журналов, изменения в подготовке математиков и т.п. Эти вопросы тоже важны, но я думаю, что прояснение той точки зрения, которую я здесь отстаиваю, облегчит обсуждение более практических вещей.

Билл Тёрстон обращался к той же идее в своем знаменитом эссе 1994 года «О доказательствах и прогрессе в математике», которое сегодня актуально как никогда. Тёрстон отмечает, что математики (как сообщество) доказывают теоремы и решают задачи, но это не всё, чем они занимаются: они также усваивают эти решения и находят им новое применение после того, как те будут доказаны. Это «переваривание» [1], в свою очередь, открывает путь следующей волне прорывов и тем самым углубляет наше понимание математики.

[1] «Переваривание» — термин, предложенный Теренсом Тао в его докладе на МКМ о математике в эпоху ИИ, часть метафоры о доказательствах, сгенерированных большими языковыми моделями, как о переносящих нас в эру изобилия доказательств, подобно массовому производству продуктов питания.

От переводчика: см. расшифровку этого доклада на Хабре: Математика в эпоху ИИ: публичная лекция Теренса Тао на Международном конгрессе математиков 24 июля 2026

Это далеко не второстепенная часть того, чем занимаются математики, наоборот, это наше истинное предназначение. Ценность математики для человечества заключается не в установлении истинности или ложности того или иного утверждения или гипотезы, а скорее в том понимании, которое мы обретаем в процессе этих изысканий (даже если сами по себе эти факты также представляют огромную ценность). Если говорить кратко, математики — это люди, которые пытаются познать причины вещей.

Felix, qui potuit rerum cognoscere causas - Блажен тот, кто смог познать причины вещей. (На табличке выгравирован отрывок из поэмы Вергилия «Георгики» (книга 2, строки 490–492): Блажен, кто смог познать причины всех вещей, Кто попрал все страхи и неумолимый рок, И шум ненасытного Ахеронта! )

Felix, qui potuit rerum cognoscere causas — Блажен тот, кто смог познать причины вещей. (На табличке выгравирован отрывок из поэмы Вергилия «Георгики» (книга 2, строки 490–492): Блажен, кто смог познать причины всех вещей, Кто попрал все страхи и неумолимый рок, И шум ненасытного Ахеронта! )

Большие языковые модели как технология ИИ, это продукт больших корпораций

Прежде чем перейти к сути разговора о больших языковых моделях и генеративном ИИ в широком математическом сообществе, нам необходимо преодолеть одно препятствие. Это препятствие представляет собой нынешнее укоренившееся, к сожалению, отождествление генеративного ИИ как технологии с генеративным ИИ как конкретным продуктом и видением крупных ИИ-компаний. Нам крайне важно провести это различие и разделить эти два понятия. То, что большинство людей подразумевает под ИИ, — это видение частных ИИ-лабораторий, и это не случайность, ведь это видение агрессивно внедряется во все сферы нашей повседневной жизни.

Хотя это может показаться невозможным, но мы можем представить себе альтернативный мир, где существует множество параллельных подходов к использованию LLM, разработанных по инициативе отдельных сообществ и отражающих разнообразие условий в различных сообществах, отраслях и институтах. Подарком для такого мира стало появление моделей с открытыми весами. Но это тема для другого эссе.

Поэтому во всем дальнейшем я буду опираться на указанное выше различие: когда я говорю о больших языковых моделях или «больших моделях», я имею в виду саму технологию, и уж точно не какие-либо крупные ИИ-компании или их продукты.

Покончив с этими вступительными оговорками, перейду к делу. Почему выходные данные LLM, содержащие новые захватывающие математические идеи, должны быть для математиков источником гордости, а не тревоги? Мой ответ во многом обязан одной очень интересной статье Генри Фаррелла, Элисон Гопник, Космы Шализи и Джеймса Эванса. Процитирую здесь одно из их утверждений:

…Большие модели следует рассматривать не столько как интеллектуальных агентов, сколько как новый вид культурных и социальных технологий, позволяющих людям использовать информацию, накопленную другими людьми.

Я постараюсь применить идеи из их статьи к математике и работе математиков. Даже если сейчас вы остановитесь и пойдете читать их статью и статью Тёрстона, я сочту это эссе успешным.

Культурные и социальные технологии

Люди всегда жили в сложном мире, и наше выживание зависело от способности обрабатывать информацию в объемах, превышающих возможности любого отдельного человека, и, вероятно, так было всегда, с момента начала существования человечества. Концепция Герберта Саймона «ограниченная рациональность» хорошо это показывает: в реальной жизни, в отличие от простейших моделей теории управления, у нас есть ограничения как по времени, отведенному на принятие решений, так и по точности нашей информации. Это означает, что агент, принимающий решения, должен отказаться от оптимальности и довольствоваться «достаточно хорошим» результатом.

Саймон понял, что одно из следствий ограниченной рациональности заключается в том, что люди вынуждены разрабатывать системы для обработки информации коллективно (и действительно так делают). Мы видим, что люди создали государства, нарративы, бюрократию, рынки, библиотеки и многое другое. Это и есть культурные и социальные технологии. Это средства, с помощью которых люди (не поодиночке, а как группа) ориентируются в огромных объемах информации, с которыми не может справиться ни один человек в одиночку. Важной особенностью этих технологий является то, что они в некоторой степени «забывчивы»: вы игнорируете или преуменьшаете значение мелких деталей, чтобы облегчить восприятие общей картины.

Рынки, правительства и бюрократия означают, что каждый человек может сосредоточиться на нескольких вещах и при этом в итоге получать выгоды. Благодаря рынкам, правительству и бюрократии я могу рассчитывать на то, что смогу купить свежие фрукты и овощи в магазине за углом от моей квартиры на Манхэттене. Благодаря рынкам, правительству и современной медицине мы теперь твердо уверены, что новорожденный ребенок доживет до взрослого возраста, что резко контрастирует с тем, что было нормой на протяжении большей части истории человечества. Культурные технологии — это мощные и внушающие благоговение вещи. Понятно, почему мы так часто склонны их очеловечивать.

На этой неделе я начал читать свой аспирантский курс по оптимизации транспорта. Я завершил первое занятие, показав одно изящное применение оптимального транспорта: «доказательство на одну страницу» для изопериметрического неравенства в {\mathbb{R}^n}. Конечно, то, что доказательство занимает всего одну страницу, зависит от того, что мы принимаем как данность.

Это стандартная практика, не только при преподавании продвинутых курсов, но и в повседневных исследованиях, и она становится возможной благодаря силе культурных технологий. В доказательстве мне не нужно с нуля объяснять понятие меры Лебега или множеств конечного периметра. Когда в середине доказательства я говорю: «Я распишу детали только для случая, когда область имеет гладкую границу, и без ограничения общности приму меру Лебега равной {1} благодаря масштабированию», я опираюсь на общепринятый прием, в котором, как я могу быть уверен, разбирается даже первокурсник-аспирант.

Всё это идет на пользу и мне, и студентам. Мы можем сосредоточиться на «одностраничном» доказательстве с интересной новой идеей: как теорема Бренье задает отображение, с помощью которого изопериметрическое неравенство по сути сводится к неравенству между средним арифметическим и средним геометрическим.

Итак, вот что в основном было написано на доске: предполагая, что {E \subset \mathbb{R}^n} имеет меру Лебега {1}, мы хотим доказать, что

\displaystyle |\partial B| \leq |\partial E|

где {B} — это {n}-мерный евклидов шар того же объема, что и {E}, то есть {|B|=1}. Затем я рассказываю своей группе, как теорема Бренье утверждает, что всегда существует отображение {T} из {E} в {B}, что это отображение сохраняет объем и что {T = \nabla u} для некоторой выпуклой функции {u}. Далее, поскольку {\det(D^2u(x))=1} и все собственные значения {D^2u(x)} неотрицательны, неравенство между средним арифметическим и средним геометрическим гласит, что {1 \leq \frac{1}{n}\Delta u} везде в {E}, и поэтому

\displaystyle 1 = |E| = \int_{E}1;dx \leq \frac{1}{n}\int_{E}\Delta u(x);dx.

Затем теорема о дивергенции и тот факт, что {||\nabla u(x)||\leq r := (1/\omega_n)^{1/n}} (где {\omega_n} — объем единичного шара) гарантируют, что

\displaystyle 1 \leq \frac{1}{n}\int_{\partial E}\nabla u(x)\cdot \nu(x);d\sigma(x) \leq \frac{1}{n}(1/\omega_n)^{1/n}|\partial E|.

Для шара объема {1} масштабирование показывает, что {|\partial B| = n\omega_n^{1/n}}, откуда мы заключаем, что {|\partial E| \geq |\partial B|}, что и требовалось доказать.

Взаимодействуя с этим доказательством, мы вступаем в диалог сквозь пространство и время со многими математиками, но особенно с Кноте (1957) и Громовым (1986), за которыми позже последовали отдельные работы Бренье, Макканна и Трудингера, и даже с моим молодым «я» в конспекте лекций, написанном вместе с Макканном, где мы разбираем вышеприведенное доказательство (см. конкретно раздел 1.6). Этот диалог опосредован общей математической культурой, которая включает в себя общие определения и методы, знание которых я могу ожидать от аспирантов. Мне не нужно доказывать теорему о дивергенции или формулу замены переменных, чтобы обосновать эти выкладки, и мне не нужно беспокоиться о гладкости {T(x)}, поскольку я могу работать через аппроксимацию.

Не вдаваясь во все эти подробности, я изложил на одной доске идею о том, что отображение Бренье ведет от неравенства между средним арифметическим и средним геометрическим к изопериметрическому неравенству, и сделал я это за последние 15 минут занятия. Это культурные технологии в действии! Какие именно культурные технологии? В данном случае это технология научного сообщества со стандартами в преподавании, математической литературой и так далее.

Большие языковые модели как культурные технологии

Главная мысль Фаррелла и соавторов заключается в том, что LLM — это культурные технологии, точно так же, как рынки, бюрократия и научные дисциплины. Соответственно, концепция культурных технологий очень полезна, когда мы пытаемся понять и осмыслить влияние больших моделей на наши дисциплины.

LLM действительно во многом похожи на пример из моей лекции, и в каком-то смысле они являются «оберткой» вокруг более старой культурной технологии: научной литературы. Когда вы задаете большой языковой модели вопрос об изопериметрическом неравенстве, принципе максимума ABP или уравнении в частных производных, вы фактически взаимодействуете с каждым человеком, который думал об этих вещах и работал над ними, при условии, что данные, на которых обучалась модель, так или иначе содержат эти идеи. Несомненно, конспект лекций, на который я ссылаюсь выше, входит в обучающие данные большинства используемых сегодня LLM, равно как и огромная часть оцифрованной математической литературы (по всем дисциплинам) была частью этих данных. LLM работают с потерями, поэтому, хотя модель и не может воспроизвести данную статью в точности так, как она была в обучающих данных, она способна воспроизвести значительные её части.

Что отличает LLM от более ранних культурных и социальных технологий, так это то, что мы оцифровали все эти данные и теперь можем легко исследовать их, воспроизводить и рекомбинировать, отправляя текстовые команды (промпты) с компьютера или даже с телефона. По сути, LLM — это первоклассные инструменты обработки информации. Они также являются превосходным инструментом для генерации текста разговорного уровня и для связного комбинирования паттернов информации, даже если они взяты из совершенно разных источников.

В результате решений, принятых на уровне продуктового дизайна в нескольких частных лабораториях, выходные данные большинства LLM имеют разговорный тон и легко поддаются очеловечиванию. Эти свойства усилили эффект, подобный эффекту ELISA, который затрагивает даже людей с продвинутой подготовкой в области математики и информатики. В каком-то смысле очеловечивание этой технологии, что, как утверждали некоторые, вовсе не было неизбежным, сослужит всем нам плохую службу: разговорный формат LLM создает видимость единого «мыслящего» субъекта и скрывает труд огромных групп людей, чьи идеи подвергаются рекомбинации. Эта видимость — особенность не самих LLM как таковых, а особенность LLM в том виде, в каком их хотят видеть ИИ-компании. Мы имеем дело не с очень умным, не с гениальным интеллектом; мы взаимодействуем с чем-то большим (и в то же время почему-то более человеческим): с совокупным творением тысячелетий человеческой изобретательности и креативности, оцифрованным и эффективно сжатым, и всё это опосредовано передовыми статистическими и генеративными алгоритмами.

В частности, любое математическое доказательство, найденное в выходных данных LLM, является коллективным результатом труда (порой, всю жизнь) множества математиков. Его следует приветствовать как плод нашего общего математического наследия, принадлежащего всему человечеству, которое передавалось через тысячелетия людьми, носившими в разные времена иные имена, нежели «математик» (натурфилософы, астрономы, геометры). Это в полной мере относится и к тем выходным данным LLM, которые содержат то, что мы могли бы счесть новыми доказательствами или идеями, ибо в конечном счете всё это — порождение того накопленного гигантского массива знаний. Здесь действует закон масштабирования, работающий уже на протяжении столетий. А недавно появившееся программное обеспечение — это лишь своего рода обертка для него.

Итак, давайте пересмотрим тот «кошмарный сценарий», с которого я начал это эссе. Однажды мы просыпаемся от новости о том, что выходные данные большой модели содержат решение гипотезы Римана. Теперь мы вооружены идеями Фаррелла и соавторов, и особенно идеей культурных технологий. Читая новости в рамках этой концепции, мы узнаем новый математический факт, но мы также узнаем, что этот факт является плодом коллективных усилий исследователей в данной области на данный момент. Проблема была вскрыта идеями одного-двух (а может, и многих) исследователей до такой степени, что решение могло быть получено путем сэмплирования и рекомбинации идей, в чем и преуспела LLM.

Но возникает деликатный вопрос: какие идеи достижимы из всей совокупности идей в математической литературе в данный момент времени? Я позаимствую из геометрии и нестрого использую метафору «выпуклой комбинации» идей, чтобы это обсудить.

Выпуклые оболочки идей

Выпуклое тело, содержащее другое, из книги «Наглядная геометрия» Гильберта и Кон-Фоссена

Выпуклое тело, содержащее другое, из книги «Наглядная геометрия» Гильберта и Кон-Фоссена

Возможности LLM значительно продвинулись за последние пару лет, а в математике — особенно стремительно только за этот год. Быстрое совершенствование затрудняет эту дискуссию. Вопрос «что могут LLM?» — это скорее движущаяся мишень, по крайней мере на текущий момент. Тем не менее, давайте попробуем подумать о смежном вопросе, который может быть не столь зависим от конкретных возможностей LLM и имеет шанс оказаться полезным, даже если он по-прежнему размыт.

Идеи иногда являются явными композициями из других, более фундаментальных идей. Иногда новая идея действительно стоит особняком от всего, что было до нее. Что бы нам сказало обнаружение решения гипотезы Римана или проблемы гладкости трёхмерных уравнений Навье-Стокса в выходных данных LLM? Одна тестируемая модель (которая может и не отражать эмпирическую реальность) состоит в том, что результат может принадлежать своего рода «замыканию» или «выпуклой оболочке» доступной литературы. В более широком смысле можно поставить следующий вопрос: Дана совокупность идей. Какие идеи можно считать находящимися заведомо за их пределами, а какие лежат ближе к их «выпуклой оболочке»?

Я не дам более конкретного определения, потому что не в состоянии это сделать. Однако я могу на примерах обсудить, что такое определение должно охватывать. Я также не использую термин «выпуклая оболочка» в том смысле, что идея является производной или что нахождение точки внутри выпуклой оболочки — простая задача: выпуклые множества высокой размерности — это крайне сложные объекты!

Как минимум, мы можем согласиться с тем, что доказательство бесконечности простых чисел вида {p \equiv b \mod a} при взаимно простых {a,b} определенно не лежит в «выпуклой оболочке» теории чисел, предшествовавшей Эйлеру и Дирихле: использование бесконечного ряда для количественной оценки «количества простых чисел» — это как раз тот тип идеи, который находился заведомо за пределами того, что считалось теорией чисел, до тех пор, пока он не был предложен. Однако сам вопрос о бесконечности простых чисел вида {an+b} (при взаимно простых {a,b}) мог быть поставлен в рамках теории чисел, существовавшей до Эйлера. Более того, для некоторых специальных значений {a} и {b} это уже было известно, например для простых чисел вида {4n+1}. Аналогично, числовые поля, идеалы и их однозначное разложение — все это идеи, лежащие далеко за пределами всей предшествовавшей им теории чисел. Однако, как только мы располагаем этими идеями вместе, уже не столь далеко за пределами выпуклой оболочки (а может быть, даже внутри неё) оказывается построение доказательства того факта, что каждый класс идеалов содержит бесконечно много простых идеалов, — комбинация идей Эйлера и Дирихле с идеей, скажем, гауссовых целых чисел.

Судя по тому, что я видел (пока что) в наиболее близких мне областях исследований, ни одна LLM не выдала ничего даже отдаленно похожего на введение Эйлером методов анализа в изучение простых чисел. Одно из возможных объяснений состоит в том, что LLM пока просто не используются для подобных задач. На самом деле, можно сказать так: Эйлер не просто отвечал на хорошо известный вопрос, а скорее говорил: «Вот на самом деле совершенно новый вопрос, о котором мы и не подозревали, что его можно задать, и который, оказывается, чрезвычайно важен и связан с более старыми проблемами!» Концепция LLM как культурных технологий, в той мере, в какой она отражает существующие модели, предполагает, что это тот тип вклада, которого мы не можем ожидать в их выходных данных.

Согласно Фарреллу и соавторам, культурным и социальным технологиям предшествуют индивидуальные способности, которые затем агрегируются и передаются с помощью технологии. В своем эссе они отмечают, что «без инноваций не было бы смысла в подражании». Предположим, у Эйлера был бы доступ к LLM, обученной на всей математике, известной к тому моменту, когда он начал работать в теории чисел. Без того, чтобы кто-то первым ввел аналитический взгляд на простые числа, нашей гипотетической большой языковой модели было бы очень трудно изобрести аналитическую теорию чисел, а затем использовать эту инновацию для решения «гипотезы» [2] о бесконечности простых чисел, сравнимых с {b} по модулю {a}, для любых взаимно простых {a,b}. Тем не менее, эта концепция совместима с радостной возможностью того, что человек, работающий с LLM, может пережить момент озарения, в котором именно он, человек, придет к этой инновации.

[2] Я говорю «гипотеза» только в контексте этого гипотетического сценария с Эйлером и его большой языковой моделью XVIII века.

Вот еще один пример, несколько иного характера. Одна из важнейших теорем в теории уравнений в частных производных — теорема Крылова-Сафонова для эллиптических и параболических уравнений в недивергентной форме. Для тех, кто не работает в этой области, это версии уравнения Лапласа и уравнения теплопроводности, с той разницей, что «коэффициенты» при частных производных не постоянны, а меняются от точки к точке.

Такие уравнения, линейные и нелинейные, возникают в изучении стохастических процессов, а также в оптимальном управлении и геометрии. Теорема Крылова-Сафонова дает гёльдерову оценку регулярности решений уравнения, которая зависит только от равномерной эллиптичности; примечательно, что эта оценка работает даже тогда, когда коэффициенты могут быть сильно разрывными. Рассмотрим для конкретности линейное уравнение вида

\displaystyle \sum_{i,j=1}^n a_{ij}(x)\partial_{ij}u(x) = 0

Когда коэффициенты {a_{ij}} гладкие, регулярность решений этого уравнения можно понять из теории уравнения Лапласа. Эвристически, гладкость коэффициентов означает, что при приближении к точке коэффициенты всё ближе и ближе к постоянным, что отделяет вас от уравнения Лапласа лишь аффинной заменой переменных. Следовательно, хорошие регуляризационные свойства уравнения Лапласа переносятся на более крупные масштабы, и таким образом доказывается, что {u} гладко. Однако эта оценка в значительной степени зависит от модуля непрерывности функций {a_{ij}(x)}.

Я не могу здесь подробно останавливаться на этом, но получение оценок для {u}, не зависящих от непрерывности коэффициентов {a_{ij}(x)}, имеет колоссальное значение. На самом деле, важность этого вопроса трудно переоценить — такие оценки имеют глубокие следствия в теории стохастических процессов, в геометрическом анализе и дифференциальной геометрии (скажем, для множества уравнений, связанных с кривизной), в стохастической гомогенизации и не только. По этой причине теорема Крылова-Сафонова является одним из важнейших результатов в теории уравнений в частных производных, которыми мы располагаем.

Однако теорема Крылова-Сафонова опирается на математический факт, пришедший из совершенно другой области: выпуклого анализа. Существует оценка Александрова, которая гласит следующее: обозначая через {B\subset\mathbb{R}^n} единичный шар, для любой функции {h:B \rightarrow\mathbb{R}}, выпуклой в {B} и равной нулю на {\partial B}, имеем

\displaystyle |h|_\infty \leq C_n |\partial h(B)|^{1/n}

где {\partial h}  обозначает субдифференциал выпуклой функции. Эта оценка справедлива для общих выпуклых тел, не только для {B}, и в такой общности она эквивалентна обратному неравенству Блашке-Сантало из выпуклой геометрии. Эта оценка является ключевым компонентом так называемой оценки Александрова-Бакельмана-Пуччи (ABP), которая, в свою очередь, необходима для теоремы Крылова-Сафонова.

Если простыми словами: без этого факта из выпуклой геометрии теорема Крылова-Сафонова не может быть доказана, по крайней мере ни одним из известных нам сегодня способов. Это весомое утверждение, поскольку многие важные теоремы в анализе допускают несколько независимых подходов к доказательству, не обязательно использующих одни и те же инструменты. Это было бы сродни вопросу о том, как доказывать результаты в геометрическом анализе и теории вероятностей без знания неравенства Пуанкаре. Без достижений в выпуклой геометрии, сделанных за много десятилетий до того, теория вполне нелинейных эллиптических уравнений, которая на первый взгляд кажется столь далекой от выпуклой геометрии, не смогла бы продвинуться так, как она продвинулась после Крылова и Сафонова.

Представьте себе параллельную вселенную, где мы пришли к технологии больших языковых моделей до того, как узнали о теореме Крылова-Сафонова, так что вопрос о регулярности для недивергентных эллиптических уравнений без зависимости от коэффициентов считается важной открытой проблемой. Концепция культурных технологий предполагает, что в этой вселенной LLM (по крайней мере при текущем уровне мощности) не смогла бы решить эту открытую проблему, если в математической литературе этой параллельной вселенной нет хорошо развитой области выпуклой геометрии и выпуклого анализа. И наоборот, если в этой параллельной вселенной существует развитая литература по выпуклой геометрии, включая оценку Александрова, то вполне правдоподобно, что большая языковая модель могла бы связать эти две вещи и прийти к оценке ABP и теореме Крылова-Сафонова.

Мысля в терминах «выпуклой оболочки идей», можно увидеть, что способность LLM решить ту или иную математическую задачу в значительной степени является функцией состояния математической литературы в данный момент времени, а не только функцией размера самой модели. С этой точки зрения событие, когда в выходных данных LLM содержится решение трудной задачи, следует приветствовать как радостное событие: LLM помогла нам откопать драгоценный камень, зарытый где-то в нашем математическом наследии, или в выпуклой оболочке, если угодно.

На самом деле, это уже произошло: менее года назад мы услышали новость о «задачах Эрдёша», решенных LLM, которые затем оказались случаями, когда модель находила решения в старых (а в некоторых случаях и забытых!) статьях. В то время это осознание было воспринято как поражение LLM. Теперь же эта ситуация в миниатюре иллюстрирует ту точку зрения, которую я здесь отстаиваю.

Творческие сообщества в турбулентные времена

Концепция LLM как культурных технологий вместе с вдохновленной ею «выпуклой оболочкой» идей позволила мне разрешить мои собственные философские сомнения относительно LLM. Она укрепила мой оптимизм в том, что математика, которую я ценю, сохранится. Однако это не отменяет того факта, что математическое сообщество сталкивается с серьёзными и неотложными вызовами. Агрессивное и узколобое навязывание своего видения со стороны ИИ-компаний вредит нашей области, усугубляя старые противоречия нашей профессии и создавая новые.

Это не первый раз, когда творческое сообщество сталкивается с турбулентным периодом или масштабными изменениями, вызванными новыми технологиями или экономическими реалиями. Мы можем извлечь уроки из прошлых случаев, как в математике, так и в других дисциплинах. Можно вспомнить художников, столкнувшихся с появлением фотографии, музыкантов, столкнувшихся с приходом синтезатора, или самих математиков — вспомним, например, создание arXiv в 1990-х. Какими бы необычными ни казались главы из истории профессионального скейтбординга, они представляют поразительные параллели с обстоятельствами в математике, и это история, содержащая множество уроков и предостережений для математиков.

Родни Маллен исполняет трюк «Невозможный» в эпизоде Physics Girl (Дианна Коуэрн)

Родни Маллен исполняет трюк «Невозможный» в эпизоде Physics Girl (Дианна Коуэрн)

К 1980-м годам скейтбординг существовал уже несколько десятилетий. У него были профессиональные соревнования, спонсорские контракты и специализированная пресса. Как и в математике, в скейтбординге была экосистема, позволявшая практикам оттачивать свое мастерство, развивать его и даже зарабатывать на этом деньги. В нем также были разделы: фристайл, верт и уличный скейтбординг. В 1984 году Кевин Харрис, пришедший из фристайла, заметил, что уличные скейтеры, имевшие за плечами всего «шесть месяцев опыта», уже зарабатывали больше, чем Родни Маллен, у которого к тому времени были десятки тысяч часов практики и почти безупречная рекордная карьера в профессиональных соревнованиях. Харрис вспоминал свою реакцию на это наблюдение так: «Так, это смерть фристайла, и это также нанесет огромный удар по верту».

Рецессия начала 1990-х нанесла сокрушительный, финальный удар по существовавшей тогда профессиональной экосистеме скейтбординга. Всего за несколько лет это направление лишилось многих площадок и крупных публичных мероприятий, вокруг которых оно строилось, и в значительной степени потеряло даже свой аналог «финансирования» — спонсорство. Этот кризис вынудил многих профессионалов досрочно уйти на пенсию. Можно было бы возразить, что с исчезновением чемпионатов и спонсоров исчезла и метрика измерения успеха, а вместе с ней и все стимулы для участия в соревновательном скейтбординге. Однако это была не единственная и даже не главная метрика, ведь скейтбординг продолжал жить и развиваться в последующие годы.

Без публичных соревнований с большой аудиторией и связанных с ними спонсоров скейтерам пришлось искать иные способы коммуникации и демонстрации своих работ. Экономические и социальные проблемы в данном случае были решены с помощью уже существовавшей технологии. Скейт-видео стало новой средой, в которой скейтеры записывали и транслировали свои работы. Раньше, если скейтер тратил бесчисленные дни на оттачивание сложного трюка, он мог показать его на чемпионате самое большее нескольким сотням, может быть, тысяче зрителей. Теперь же видеокассету с работами нескольких скейтеров могли увидеть десятки тысяч людей. Раньше скейтер, не выигравший несколько чемпионатов, рисковал остаться непризнанным. Теперь же скейтеру достаточно было одной хорошей «части» — сольного сегмента одного скейтера в видео, чтобы быть признанным и внести новые трюки в арсенал скейт-сообщества. Самые успешные видео представляли новый трюк или новый поворот старого, который затем повторяли и адаптировали другие.

Примечательно, что выход из кризиса сделал скейтбординг немного менее соревновательным видом спорта и немного более совместным, творческим направлением, где видеокассеты играли роль журналов [3], а видеовыступления — роль статей в этих журналах.

[3] В математике же мы тем временем на самом деле приближаемся к ситуации, когда нам придется перейти к тому, что придет на смену журналам, или, по крайней мере, журналам в том виде, в каком они понимаются сейчас.

Этот турбулентный переход в итоге оказался благом для скейтбординга как дисциплины, хотя для многих отдельных скейтеров он обернулся ухудшением положения. Эта экосистема во многом остается неизменной и сегодня (просто интернет-видео заменило видеокассеты). Мотивацией для скейтера участвовать в жизни сообщества, помимо любви к самому катанию, была возможность продемонстрировать свой вклад в видео и поделиться своими идеями с другими, которые могли бы попытаться повторить их или скомбинировать по-новому.

Маллен говорил, что изобретение становится инновацией только тогда, когда сообщество его принимает. Это дает меру ценности работы. В математике мы часто говорим о «влиянии» статьи или идеи, и это совершенно аналогично влиянию трюка: приняло ли сообщество эту идею, использовало ли ее, модифицировало ли дальше? Помогла ли эта работа новичкам в данной области легче понять современное состояние дел?

Возвращение к нашему математическому наследию и будущее математики

Один из уроков, который я извлек из концепции культурных технологий, заключается в том, что самый ценный компонент в LLM, та часть, которая в наибольшей степени отвечает за любую ценность в ее выходных данных, — это созданный человеком труд, культурное и техническое наследие, закодированное в ней. На протяжении этого лета крупнейшие ИИ-компании преподносили решение громких математических задач как форму пиара для своих продуктов. Нам, математикам, нужно опереться на наше любопытство и любовь к математике и приветствовать эти новые знания, не позволяя их происхождению испортить нам радость от них. Мы должны противостоять пагубному заблуждению, что якобы «ИИ победил математиков в решении задачи X», которое продвигается корпоративными ИИ-лабораториями. Вместо этого мы можем отпраздновать тот факт, что именно наше понимание математики вместе с нашей креативностью лежит в основе тех математических жемчужин, которые LLM помогают нам обнаруживать.

Ранее в этом эссе я касался важности разделения LLM (как технологии) и ИИ (как продукта и видения ИИ-компаний). Что ж, нам также нужно сделать это реальностью для нашей математической инфраструктуры. Первоочередной задачей сообщества должно стать продвижение и работа над миром с открытыми LLM — представьте себе аналог свободного программного обеспечения для LLM. Было бы весьма прискорбно, если бы наша профессия стала зависеть от капризов ИИ-индустрии, чьи лидеры обитают во вселенной идей и принципов, столь отличной от нашей вселенной в науке и математике, что ничего плодотворного или искреннего не может возникнуть из ассоциации с ними [4].

[4] Здесь я целенаправленно заимствую фразу, которая давно мне нравится. Она была написана Бертраном Расселом в ответ Освальду Мосли.

Мы должны помнить, что двигатель внутреннего сгорания никогда не был наследием или исключительным созданием автопроизводителей Детройта; железные дороги и локомотивы не были исключительным наследием разбойников-баронов Позолоченного века; и точно так же верно, что LLM никоим образом фундаментально не принадлежат крупным индустриальным лабораториям в районе залива. Перспектива «выпуклой оболочки», представленная в этом эссе, подсказывает, что стоит изучить более легкие, специфичные для математики LLM с тщательно подобранными данными и оценить масштаб технических (и финансовых) препятствий для создания такой системы. Это продемонстрировало бы, что «ров» больших лабораторий не так глубок, как им хотелось бы.

Нам также следует подходить к использованию LLM с открытым настроем, экспериментируя и исследуя, пока мы не найдем те практики работы с ними, которые лучше всего служат нашим ценностям: продвижению человеческого понимания математики, как выразился бы Тёрстон. Это также означает работу в рамках сообщества над минимизацией сбоев в математических карьерах, чтобы как можно меньше людей разделили судьбу тех скейтеров, у которых не было иного выбора, кроме как досрочно уйти на пенсию. Это также должно включать защищающую деятельность: требование радикального увеличения государственного финансирования науки и деятельность, направленную на серьезный общественный контроль над крупными ИИ-лабораториями. Мы также должны экспериментировать с созданием новых социальных структур и профессиональных договоренностей в математике, чтобы позволить как можно большему числу людей оставаться частью математического сообщества. Если мы преуспеем в этом, математическое сообщество выйдет из этого турбулентного периода более сильным, служа образцом для других сообществ и отраслей, работающих над переходом в мир повсеместно используемых LLM.

Возвращаясь к тому, с чего мы начали: выходные данные LLM, «решающие» нелокальную ABP или гипотезу Малера, были бы, независимо от обстоятельств и в строгом смысле, триумфом для дисциплины. Это не значит, что мы не можем испытывать по этому поводу смешанные чувства. Неприятно быть живым, мыслящим человеком, обработанным и скомпонованным с помощью LLM, и не менее неприятно, когда машины компонуют коллективные знания в нашей области. Но вместо того чтобы быть ущемлёнными этим, мы должны быть исполнены благоговения, причем не перед технологией, а перед огромностью и силой математического знания, которое мы создали к сегодняшнему дню. Большие модели сделали эту грандиозность очевидной и не позволяющей её игнорировать. Математики должны присвоить себе такие достижения как законный плод нашей дисциплины и, соответственно, гордиться ими, понимать их, принимать их и продолжать продвигать математику. Да будем счастливы мы, способные познать причины вещей.

ссылка на оригинал статьи https://habr.com/ru/articles/1081822/