Мне попался пост рекрутингового агентства. Смысл такой: из России кандидаты идут третьим сортом, поэтому здесь агентство больше не работает и переориентируется на зарубежные рынки найма. Я читал это и понимал, что задело по-настоящему. Настолько, что решил вернуться к текстам именно с этой темы.
Сначала я возмутился. Потом сел, остыл и поймал себя на неприятной мысли: а если, по сути, верно? Наши большие языковые модели идут за флагманами с отставанием примерно в полтора года — это моё ощущение по опыту использования в повседневных задачах. Громких открытий последнего времени в машинном обучении я навскидку не назову. Может, человек просто сказал вслух то, что многие думают.
Спорить ощущениями с ощущениями бессмысленно, поэтому я пошёл собирать список. Не «наши достижения» в жанре парадного отчёта, а конкретно: что сделали люди из российских лабораторий и компаний и что из этого сегодня реально используют в мире.
Что нашлось за последние пятнадцать лет
|
Автор(ы) |
Год |
Достижение |
Где сделано |
|
Иван Оселедец |
2011 |
Tensor Train разложение — сжатие нейросетей, квантовые вычисления, численная линейная алгебра |
ИВМ РАН, затем Сколтех |
|
Артём Бабенко, Виктор Лемпицкий |
2014 |
Additive Quantization и Neural Codes for Image Retrieval — вклад в современный ANN-поиск |
Yandex, Сколтех |
|
Дмитрий Ульянов, Андреа Ведальди, Виктор Лемпицкий |
2016 |
Instance Normalization — базовый слой style transfer и многих GAN |
Сколтех и Оксфорд |
|
Алексей Миловидов и команда |
2016 |
ClickHouse — один из лидеров сегмента аналитических СУБД, крупный open source проект |
Yandex, Москва |
|
Л. Прохоренкова, Г. Гусев, А. Воробьёв, А. Дорогуш, А. Гулин |
2017-2018 |
CatBoost — одна из трёх основных мировых библиотек градиентного бустинга |
Yandex, Москва |
|
Дмитрий Молчанов, Арсений Ашуха, Дмитрий Ветров |
2017 |
Sparse Variational Dropout (ICML) — байесовское разрежение сетей |
ВШЭ, Сколтех |
|
Михаил Бурцев и команда |
2017 |
DeepPavlov — открытый фреймворк для диалоговых систем |
МФТИ, Москва |
|
Дмитрий Ульянов, Андреа Ведальди, Виктор Лемпицкий |
2018 |
Deep Image Prior — архитектура сети работает как приор, без обучающих данных |
Сколтех и Оксфорд |
|
А. Буслаев, В. Игловиков, Е. Хведченя, А. Паринов, М. Дружинин, А. Калинин |
2018–2020 |
Albumentations — де-факто стандарт аугментации изображений |
Распределённая команда, часть соавторов в США |
|
Е. Захаров, А. Шишея, Е. Бурков, В. Лемпицкий |
2019 |
Few-Shot Talking Heads (ICCV) — анимация лица по одному кадру |
Samsung AI Center Moscow |
|
Алексей Досовицкий |
2020 |
Vision Transformer — первый автор ViT |
Google Brain, Берлин |
|
Ю. Горишний, И. Рубачёв, В. Хрульков, А. Бабенко |
2021 |
FT-Transformer и ревизия глубоких моделей для табличных данных — новый бенчмарк-стандарт |
Yandex Research |
|
Sber AI, SberDevices |
2021-2023 |
ruGPT-3, ruDALL-E, Kandinsky 2.x — одни из немногих незападных открытых генеративных моделей |
Сбер, Москва |
|
Yandex Research |
2022 |
YaLM 100B — крупная открытая LLM; «крупнейшая вне США и Китая» верно только для короткого окна до выхода BLOOM 176B |
Yandex, Москва |
|
Александр Коротин, Евгений Бурнаев и группа |
2021–2024 |
Нейросетевой оптимальный транспорт; ведущий автор Коротин, Бурнаев чаще в роли руководителя |
Сколтех |
Меня в этом списке зацепило не количество строк, а то, где эти работы живут. CatBoost стоит в проде у людей, которые понятия не имеют, кто такие Прохоренкова и Гулин. Instance Normalization — слой, который лежит в основе половины генеративных моделей, включая те, чьими картинками сейчас забиты ленты. Albumentations открывают в любом ноутбуке с компьютерным зрением, не задумываясь о происхождении. Tensor Train Оселедца ушёл далеко за пределы машинного обучения, в квантовые вычисления. Оказалось, что у нас стране разрабатывался и разрабатывается не просто продукт, на уровне продуктов, а фундамент для других продуктов.
Оговорюсь, иначе будет нечестно. Часть команд из таблицы распределённые, часть авторов давно работает за рубежом. Досовицкий делал ViT в берлинском офисе Google, а не в Москве. Лемпицкий соавторствовал с Оксфордом. Я не считаю это контраргументом. Скорее наоборот: если школа готовит людей, которых потом забирают в первые лаборатории мира, вопрос к качеству школы закрыт. Вопрос остаётся к тому, почему они там, а не здесь, — но это другая тема.
Бонус для тех, кто любит копнуть глубже
Раз уж я взялся копать, дошёл и до советского периода. Здесь картина оказалась ещё жёстче.
|
Автор(ы) |
Год |
Достижение |
Где сделано |
|
Андрей Тихонов |
1943, 1963 |
Регуляризация некорректных задач — в западной литературе Tikhonov regularization, она же ridge и weight decay |
МГУ, ИПМ, Москва |
|
Андрей Колмогоров, Владимир Арнольд |
1957 |
Теорема о представлении непрерывных функций — предок теорем универсальной аппроксимации и современных KAN |
МГУ, МИАН, Москва |
|
Марк Айзерман, Эммануил Браверман, Лев Розоноэр |
1964 |
Метод потенциальных функций — первая формулировка «ядерного трюка», позже основа kernel methods |
ИПУ, Москва |
|
Борис Поляк |
1964 |
Метод «тяжёлого шарика» — momentum, лежит в основе SGD с моментом и Adam |
МГУ, затем ИПУ РАН, Москва |
|
Алексей Ивахненко |
1965–1971 |
МГУА (GMDH) — многослойные обучаемые модели; Шмидхубер называет это первым глубоким обучением |
Институт кибернетики, Киев |
|
Владимир Вапник, Алексей Червоненкис |
1968–1974 |
VC-размерность и теория статистического обучения — фундамент оценки обобщающей способности |
ИПУ, Москва |
|
Аркадий Немировский, Давид Юдин |
1979–1983 |
Зеркальный спуск и нижние оценки сложности выпуклой оптимизации |
Москва |
|
Юрий Нестеров |
1983 |
Ускоренный градиентный метод (NAG) — стандартный оптимизатор во всех фреймворках |
ЦЭМИ, Москва |
|
Борис Поляк, Анатолий Юдицкий |
1990–1992 |
Усреднение траектории SGD (Поляк–Рупперт); Рупперт получил результат независимо в США |
Москва |
Посмотрите на этот список глазами человека, который вчера писал код. Вы поставили momentum в оптимизаторе — это Поляк, 1964 год, Москва. Включили weight decay — это Тихонов. Взяли Adam или SGD с ускорением — там внутри Нестеров, 1983-й. Объясняете студенту, почему модель обобщается, — объясняете через Вапника и Червоненкиса. Половина того, что сегодня крутится в каждом фреймворке, придумана в московских и киевских институтах за десятилетия до того, как слово «нейросеть» вышло за пределы узкого круга.
Откуда тогда взялось ощущение третьего сорта
Мне кажется, автор поста перепутал спрос и качество. Заказов на найм стало меньше, отклики идут хуже, значит рынок мёртвый, значит люди слабые. Логика понятная, только между этими шагами нет связи.
Спад найма в ИИ — глобальная история. То же самое говорят коллеги в США, Европе, Китае, Бразилии. Отрасль наигралась в бесконечный рост команд и начала считать деньги: сколько модель стоит, что она приносит, зачем нам сорок человек там, где справятся восемь. Это коррекция, а не смерть. И когда у агентства падает поток заказов, объяснить это качеством кандидатов проще, чем тем, что заказчик стал разборчивее и научился нанимать сам.
Есть и вторая часть, менее приятная для нас. Прикладная сила у российских команд действительно высокая, а вот с продуктовой упаковкой и с публичностью беда. Про CatBoost знают все, кто им пользуется, и почти никто из тех, кто принимает решения о бюджетах. Мы плохо рассказываем о том, что делаем, и потом удивляемся оценкам со стороны.
Что я вынес из этого как руководитель
Когда я собираю или усиливаю ИТ-команду, самое опасное — нанимать по рыночному шуму. Если верить постам вроде того, с которого я начал, легко решить, что сильных людей на рынке нет и надо либо переплачивать за иностранцев, либо отдавать всё подрядчику. По моему опыту вывод ровно обратный: сильные есть, их просто не найти теми фильтрами, которыми ищут массовый поток. Они не рассылают резюме пачками и редко проходят через агентства.
Второе. Отставание в моделях и уровень инженеров — разные вещи, и путать их дорого. Отставание в больших моделях упирается в вычислительные мощности и деньги на обучение, а не в мозги. Задача, которая стоит перед бизнесом, обычно решается не собственной LLM, а нормальной интеграцией уже существующей — и вот здесь квалификация команды решает всё.
Третье, самое практичное. Прежде чем принимать чужую оценку рынка, проверьте её сами. Мне понадобился вечер и таблица, чтобы аргумент, который казался убийственным, рассыпался. Точно так же рассыпаются оценки подрядчиков, вендоров и консультантов, если не полениться разобрать их по фактам.
А вы тоже считаете, что мы в своей стране максимально отстаём в ИИ? Напишите в комментариях, что вы видите со своей стороны: как выглядит найм ML/AI-специалистов у вас, находите ли людей, приходится ли смотреть за границу. Мне правда интересно прочитать мнения тех, кто нанимает, а не тех, кто про это пишет.
Артём Дьяченко
Руководитель ИТ и цифровой трансформации на промышленных предприятиях
ссылка на оригинал статьи https://habr.com/ru/articles/1062384/