«Третий сорт»: я проверил претензию к российским AI-специалистам по фактам

от автора

Мне попался пост рекрутингового агентства. Смысл такой: из России кандидаты идут третьим сортом, поэтому здесь агентство больше не работает и переориентируется на зарубежные рынки найма. Я читал это и понимал, что задело по-настоящему. Настолько, что решил вернуться к текстам именно с этой темы.

Сначала я возмутился. Потом сел, остыл и поймал себя на неприятной мысли: а если, по сути, верно? Наши большие языковые модели идут за флагманами с отставанием примерно в полтора года — это моё ощущение по опыту использования в повседневных задачах. Громких открытий последнего времени в машинном обучении я навскидку не назову. Может, человек просто сказал вслух то, что многие думают.

Спорить ощущениями с ощущениями бессмысленно, поэтому я пошёл собирать список. Не «наши достижения» в жанре парадного отчёта, а конкретно: что сделали люди из российских лабораторий и компаний и что из этого сегодня реально используют в мире.

Что нашлось за последние пятнадцать лет

Автор(ы)

Год

Достижение

Где сделано

Иван Оселедец

2011

Tensor Train разложение — сжатие нейросетей, квантовые вычисления, численная линейная алгебра

ИВМ РАН, затем Сколтех

Артём Бабенко, Виктор Лемпицкий

2014

Additive Quantization и Neural Codes for Image Retrieval — вклад в современный ANN-поиск

Yandex, Сколтех

Дмитрий Ульянов, Андреа Ведальди, Виктор Лемпицкий

2016

Instance Normalization — базовый слой style transfer и многих GAN

Сколтех и Оксфорд

Алексей Миловидов и команда

2016

ClickHouse — один из лидеров сегмента аналитических СУБД, крупный open source проект

Yandex, Москва

Л. Прохоренкова, Г. Гусев, А. Воробьёв, А. Дорогуш, А. Гулин

2017-2018

CatBoost — одна из трёх основных мировых библиотек градиентного бустинга

Yandex, Москва

Дмитрий Молчанов, Арсений Ашуха, Дмитрий Ветров

2017

Sparse Variational Dropout (ICML) — байесовское разрежение сетей

ВШЭ, Сколтех

Михаил Бурцев и команда

2017

DeepPavlov — открытый фреймворк для диалоговых систем

МФТИ, Москва

Дмитрий Ульянов, Андреа Ведальди, Виктор Лемпицкий

2018

Deep Image Prior — архитектура сети работает как приор, без обучающих данных

Сколтех и Оксфорд

А. Буслаев, В. Игловиков, Е. Хведченя, А. Паринов, М. Дружинин, А. Калинин

2018–2020

Albumentations — де-факто стандарт аугментации изображений

Распределённая команда, часть соавторов в США

Е. Захаров, А. Шишея, Е. Бурков, В. Лемпицкий

2019

Few-Shot Talking Heads (ICCV) — анимация лица по одному кадру

Samsung AI Center Moscow

Алексей Досовицкий

2020

Vision Transformer — первый автор ViT

Google Brain, Берлин

Ю. Горишний, И. Рубачёв, В. Хрульков, А. Бабенко

2021

FT-Transformer и ревизия глубоких моделей для табличных данных — новый бенчмарк-стандарт

Yandex Research

Sber AI, SberDevices

2021-2023

ruGPT-3, ruDALL-E, Kandinsky 2.x — одни из немногих незападных открытых генеративных моделей

Сбер, Москва

Yandex Research

2022

YaLM 100B — крупная открытая LLM; «крупнейшая вне США и Китая» верно только для короткого окна до выхода BLOOM 176B

Yandex, Москва

Александр Коротин, Евгений Бурнаев и группа

2021–2024

Нейросетевой оптимальный транспорт; ведущий автор Коротин, Бурнаев чаще в роли руководителя

Сколтех

Меня в этом списке зацепило не количество строк, а то, где эти работы живут. CatBoost стоит в проде у людей, которые понятия не имеют, кто такие Прохоренкова и Гулин. Instance Normalization — слой, который лежит в основе половины генеративных моделей, включая те, чьими картинками сейчас забиты ленты. Albumentations открывают в любом ноутбуке с компьютерным зрением, не задумываясь о происхождении. Tensor Train Оселедца ушёл далеко за пределы машинного обучения, в квантовые вычисления. Оказалось, что у нас стране разрабатывался и разрабатывается не просто продукт, на уровне продуктов, а фундамент для других продуктов.

Оговорюсь, иначе будет нечестно. Часть команд из таблицы распределённые, часть авторов давно работает за рубежом. Досовицкий делал ViT в берлинском офисе Google, а не в Москве. Лемпицкий соавторствовал с Оксфордом. Я не считаю это контраргументом. Скорее наоборот: если школа готовит людей, которых потом забирают в первые лаборатории мира, вопрос к качеству школы закрыт. Вопрос остаётся к тому, почему они там, а не здесь, — но это другая тема.

Бонус для тех, кто любит копнуть глубже

Раз уж я взялся копать, дошёл и до советского периода. Здесь картина оказалась ещё жёстче.

Автор(ы)

Год

Достижение

Где сделано

Андрей Тихонов

1943, 1963

Регуляризация некорректных задач — в западной литературе Tikhonov regularization, она же ridge и weight decay

МГУ, ИПМ, Москва

Андрей Колмогоров, Владимир Арнольд

1957

Теорема о представлении непрерывных функций — предок теорем универсальной аппроксимации и современных KAN

МГУ, МИАН, Москва

Марк Айзерман, Эммануил Браверман, Лев Розоноэр

1964

Метод потенциальных функций — первая формулировка «ядерного трюка», позже основа kernel methods

ИПУ, Москва

Борис Поляк

1964

Метод «тяжёлого шарика» — momentum, лежит в основе SGD с моментом и Adam

МГУ, затем ИПУ РАН, Москва

Алексей Ивахненко

1965–1971

МГУА (GMDH) — многослойные обучаемые модели; Шмидхубер называет это первым глубоким обучением

Институт кибернетики, Киев

Владимир Вапник, Алексей Червоненкис

1968–1974

VC-размерность и теория статистического обучения — фундамент оценки обобщающей способности

ИПУ, Москва

Аркадий Немировский, Давид Юдин

1979–1983

Зеркальный спуск и нижние оценки сложности выпуклой оптимизации

Москва

Юрий Нестеров

1983

Ускоренный градиентный метод (NAG) — стандартный оптимизатор во всех фреймворках

ЦЭМИ, Москва

Борис Поляк, Анатолий Юдицкий

1990–1992

Усреднение траектории SGD (Поляк–Рупперт); Рупперт получил результат независимо в США

Москва

Посмотрите на этот список глазами человека, который вчера писал код. Вы поставили momentum в оптимизаторе — это Поляк, 1964 год, Москва. Включили weight decay — это Тихонов. Взяли Adam или SGD с ускорением — там внутри Нестеров, 1983-й. Объясняете студенту, почему модель обобщается, — объясняете через Вапника и Червоненкиса. Половина того, что сегодня крутится в каждом фреймворке, придумана в московских и киевских институтах за десятилетия до того, как слово «нейросеть» вышло за пределы узкого круга.

Откуда тогда взялось ощущение третьего сорта

Мне кажется, автор поста перепутал спрос и качество. Заказов на найм стало меньше, отклики идут хуже, значит рынок мёртвый, значит люди слабые. Логика понятная, только между этими шагами нет связи.

Спад найма в ИИ — глобальная история. То же самое говорят коллеги в США, Европе, Китае, Бразилии. Отрасль наигралась в бесконечный рост команд и начала считать деньги: сколько модель стоит, что она приносит, зачем нам сорок человек там, где справятся восемь. Это коррекция, а не смерть. И когда у агентства падает поток заказов, объяснить это качеством кандидатов проще, чем тем, что заказчик стал разборчивее и научился нанимать сам.

Есть и вторая часть, менее приятная для нас. Прикладная сила у российских команд действительно высокая, а вот с продуктовой упаковкой и с публичностью беда. Про CatBoost знают все, кто им пользуется, и почти никто из тех, кто принимает решения о бюджетах. Мы плохо рассказываем о том, что делаем, и потом удивляемся оценкам со стороны.

Что я вынес из этого как руководитель

Когда я собираю или усиливаю ИТ-команду, самое опасное — нанимать по рыночному шуму. Если верить постам вроде того, с которого я начал, легко решить, что сильных людей на рынке нет и надо либо переплачивать за иностранцев, либо отдавать всё подрядчику. По моему опыту вывод ровно обратный: сильные есть, их просто не найти теми фильтрами, которыми ищут массовый поток. Они не рассылают резюме пачками и редко проходят через агентства.

Второе. Отставание в моделях и уровень инженеров — разные вещи, и путать их дорого. Отставание в больших моделях упирается в вычислительные мощности и деньги на обучение, а не в мозги. Задача, которая стоит перед бизнесом, обычно решается не собственной LLM, а нормальной интеграцией уже существующей — и вот здесь квалификация команды решает всё.

Третье, самое практичное. Прежде чем принимать чужую оценку рынка, проверьте её сами. Мне понадобился вечер и таблица, чтобы аргумент, который казался убийственным, рассыпался. Точно так же рассыпаются оценки подрядчиков, вендоров и консультантов, если не полениться разобрать их по фактам.

А вы тоже считаете, что мы в своей стране максимально отстаём в ИИ? Напишите в комментариях, что вы видите со своей стороны: как выглядит найм ML/AI-специалистов у вас, находите ли людей, приходится ли смотреть за границу. Мне правда интересно прочитать мнения тех, кто нанимает, а не тех, кто про это пишет.

Артём Дьяченко

Руководитель ИТ и цифровой трансформации на промышленных предприятиях

ссылка на оригинал статьи https://habr.com/ru/articles/1062384/