ИИ за полтора часа взял задачу, над которой статистики бились 20 лет

от автора

Эдгар Добрибан, статистик из Уортонской школы Пенсильванского университета, сел за разговор с GPT-5.6 Pro. Модели он дал только математическое определение процедуры Бенджамини-Хохберга и вопрос: доказать или опровергнуть. Примерно через полтора часа рассуждений она выдала доказательство, конкретный контрпример и код численного сертификата к нему.

Все это легло в основу препринта, вышедшего 13 июля. Разговор с моделью Добрибан выложил целиком, полный сертификат вынес в приложение, код для воспроизведения — на GitHub. Через три дня появился второй препринт — Лихуа Лея из Стэнфордской школы бизнеса. Он занимался этой же задачей больше пяти лет и не мог ее взять. В благодарностях он пишет прямо: именно неожиданный контрпример Добрибана заново разжег интерес к проекту. Дальше события пошли с той скоростью, ради которой эту историю и стоит рассказывать.

Сначала о том, что вообще сломали. Представьте, что вы разом проверяете двадцать тысяч гипотез — скажем, ищете гены, связанные с болезнью. Привычный порог «p меньше 0.05» здесь бесполезен: даже при полном отсутствии эффекта примерно каждый двадцатый ген покажется значимым, то есть около тысячи ложных находок на ровном месте. Классическое лекарство — поправка Бонферрони, делим порог на число гипотез. Работает, но душит: при двадцати тысячах гипотез искать придется на уровне 0.0000025, и настоящие эффекты утонут вместе с ложными.

В 1995 году Йоав Бенджамини и Йосеф Хохберг предложили другое. Контролировать не вероятность хотя бы одной ошибки, а долю мусора среди находок. Вы заранее говорите, что готовы смириться с 5% ложных открытий, — и получаете процедуру: p-значения сортируются по возрастанию, каждое сравнивается со своим порогом, который тем мягче, чем дальше номер в списке, а отвергается все до самого дальнего прошедшего. Ожидаемая доля ложных срабатываний среди отвергнутых и называется FDR. Метод стал стандартом в геномике, нейровизуализации и A/B-тестировании, а оригинальную статью процитировали больше 130 тысяч раз.

Дыра была в фундаменте с самого начала. Гарантия доказана для независимых тестов и для положительной зависимости специального вида. А в реальных данных тесты коррелированы почти всегда: гены наследуются сцепленно, соседние области мозга активируются вместе, финансовые показатели ходят строем. Держится ли гарантия при произвольной корреляции? Двадцать лет считалось, что да. Симуляции нарушений не находили, Бенджамини в обзоре 2010 года называл свидетельства убедительными, но признавал, что полного доказательства нет. Уилл Фитиан из Беркли называл эту гипотезу самой интересной открытой задачей в своей области статистики.

Модель ее опровергла. Конструкция Добрибана — гауссовская факторная модель из трех блоков координат, в которой при номинальном уровне 0.01 реальный FDR строго превышает 0.0104. Разрыв крошечный, но он не оценочный: финальное неравенство подтверждено интервально-арифметическим сертификатом, то есть машинно проверяемым вычислением с гарантированным округлением. Гипотеза, стоявшая двадцать лет, оказалась просто неверной.

Есть деталь, которую почти не заметили в новостях середины июля. До GPT-5.6 Pro Добрибан пробовал взять ту же задачу с GPT-5.5 — несколько агентов, около двадцати часов работы, безрезультатно. Стена держала не только людей, но и предыдущее поколение моделей, а рухнула она за девяносто минут. Сам подход, по признанию автора, оказался не то чтобы удивительным: две известные техники, соединенные в комбинации, которую раньше никто не пробовал. Сложность была не в инструментах, а в том, чтобы понять, в какую сторону идти.

А дальше начинается то, чего модель за полтора часа не сделала. Лей ответил не контрпримером, а полной картиной. Он доказал, что BH нарушает контроль не в отдельной точке, а на каждом уровне q без исключений: худший возможный FDR всегда строго больше номинального. Вывел точную формулу для нижней границы этого худшего случая и скорость ее роста — при малых q она ведет себя как q, умноженное на корень из логарифма единицы, деленной на q, с коэффициентом около 0.3. Отдельно разобрал односторонние тесты, где все оказалось вдвое хуже, и доказал совпадающие верхние границы для важного класса моделей: там его константы уже не приблизительные, а окончательные. Разница видна и в мелочи: Добрибан доказывает неравенство для всех достаточно больших наборов гипотез, Лей выписывает конкретные конечные модели с невырожденной корреляционной матрицей.

Как выглядит эта скорость в цифрах. Первая версия статьи Лея от 16 июля весила 16 килобайт. Версия от 20 июля — 43. Версия от 22 июля — 66 килобайт и семьдесят страниц, уже с односторонними тестами; она и лежит сейчас на arXiv. Текст, датированный 5 августа, перевалил за девяносто страниц: там появились точные константы для обеих постановок и та самая финальная гипотеза. Три недели против пяти предыдущих лет тупика — при том, что человеческого труда автор насчитал около 180 часов на генерацию идей, проверку, исправления, упрощения и написание текста, и настаивает, что его вклад равновелик вкладу модели.

Механика поломки контринтуитивна, и у двух авторов она разная. У Лея все тестовые статистики завязаны на один общий фактор — грубо говоря, на скрытую переменную, которая двигает их разом. Конструкция подобрана так, что при неудачном значении этого фактора настоящие сигналы выпадают из числа отклонений, а порог уезжает наружу, туда, где хвосты нулевого распределения тяжелее, и мусора среди находок становится больше положенного. У Добрибана наоборот: сигнальные блоки движутся против фактора, и при том же неудачном значении они не гаснут, а разгораются — отклонений становится больше ровно тогда, когда нулевые хвосты потяжелели. Один и тот же результат достигается с двух противоположных сторон.

Но самое неожиданное вскрылось у Лея. У Добрибана сигналы коррелируют с нулями отрицательно, и поломку можно было списать на знакомый эффект. А в двусторонней конструкции Лея все корреляции строго положительные — и процедура все равно ломается. Виновата не отрицательная зависимость, а взятие модуля: эта операция складывает два хвоста, толкающих соседние координаты в противоположные стороны, и рушит монотонность, на которой держатся классические доказательства.

Теперь о том, чего в этой истории пока нет. Оба препринта не прошли рецензирование. У Добрибана есть машинно проверяемый сертификат, но у Лея — обычное доказательство на девяносто с лишним страниц, которое сообщество еще не верифицировало. Точные константы доказаны только для класса моделей с одним общим фактором; для произвольной корреляционной матрицы известна лишь нижняя граница, и вопрос, совпадает ли она с истиной, — та самая гипотеза, которую, как пишет Лей, не смогли опровергнуть ни он, ни GPT-5.6 Sol. Числа в таблицах читаются соответственно: при уровне 0.05 раздувание составляет не менее 26% для двусторонних тестов и не менее 62% для односторонних.

Значит ли это, что пора выбрасывать BH? Скорее нет. Обрушена не всякая гарантия, а обещание уложиться в множитель, не зависящий ни от уровня, ни от числа гипотез: потолок для произвольной зависимости есть и раньше — это поправка Бенджамини-Екутиели, которая при двадцати тысячах гипотез ужесточает порог примерно вдесятеро и потому на практике почти не используется. Сам Лей в заключении зовет не назад к ней, а вперед — к процедурам, которые умеют работать с зависимостью: условной калибровке, которую он же с Фитианом предложил в 2022 году, и калиброванным knockoffs. Так что вывод из двух июльских препринтов не «все сломано» и не «все в порядке», а третий: у привычного метода теперь известна цена, и появился повод посмотреть на то, что придумали ему на смену.

P.S. Поддержать меня можно подпиской на канал «сбежавшая нейросеть«, где я рассказываю про ИИ с творческой стороны.

ссылка на оригинал статьи https://habr.com/ru/articles/1067186/