Точность 99,2% и ни одной найденной опухоли: во что обходится компьютерное зрение в медицине

от автора

Разговор всегда начинается одинаково.

«Вы же делаете детекцию брака на конвейере. Там деталь и дефект, тут снимок и опухоль. Разница в датасете. Дайте модель, которая находит рак, точность нужна процентов 98, ну 99, чтобы наверняка».

Логика в этом есть, и я не иронизирую. Архитектурно между дефектом сварного шва и узлом в легком действительно нет пропасти, обе задачи это поиск аномалии на картинке, и обе решаются примерно одним семейством сетей. Человек напротив рассуждает правильно ровно до того момента, пока не произносит слово «точность».

Дальше я обычно прошу пять минут и открываю калькулятор.

В шведском исследовании MASAI, финальные результаты которого The Lancet опубликовал 29 января 2026 года, участвовали 105 934 женщины. Возьмем группу, где маммограммы смотрели с ИИ‑поддержкой: 53 043 участницы, у 420 из них за время наблюдения нашли рак молочной железы. Распространенность 0,79%.

Теперь пишем модель. Она принимает снимок и возвращает «норма». Всегда. Никакого обучения, три строчки на питоне, разработка тридцать секунд.

Ее точность на этой выборке 99,21%.

Заказчик просил 98–99. Константа выдает 99,2 и не находит ни одной опухоли. И вот отсюда начинается настоящий разговор, потому что дальше выясняется, что неправильно посчитана не только метрика.

Я честно пробовал сосчитать такой проект целиком: от метрики до момента, когда первый пациент увидит результат. Каждый шаг упирается в стену, которую снаружи не видно, и стены эти в основном не про нейросети. Дальше я иду по ним в том порядке, в каком они встречаются на проекте, и в конце получается ответ на вопрос «когда». Не прогноз, а результат счета.

Пара слов, откуда я на это смотрю. Я CTO в ML‑команде MoranaLabs, компьютерное зрение у нас основной хлеб: цех, ритейл, промышленный контроль, безопасность. Медицинские задачи приносят регулярно, мы их считаем, часть считаем и отговариваем. Все цифры ниже публичные, со ссылками, никаких «у нас на стенде вышло 97,3%».

Константа, которая обыгрывает нейросеть

Точность (accuracy) это доля правильных ответов. На сбалансированных данных нормальная метрика. На скрининге, где больных меньше процента, она вырождается в измерение распространенности болезни, и та самая константа обыгрывает любую честно обученную сеть, которая хоть иногда рискует сказать «подозрительно».

Меряют поэтому другое.

Чувствительность отвечает на вопрос, какую долю реально больных модель поймала. Промах здесь означает, что человек ушел домой спокойным и вернулся через два года с четвертой стадией.

Специфичность отвечает, какую долю здоровых модель не тронула. Промах тут дешевле, но он совсем не бесплатный: вызов на дообследование, повторный снимок, УЗИ, биопсия, три недели ожидания гистологии и все, что происходит с человеком за эти три недели.

Вот что получилось у MASAI, а это на сегодня лучшее рандомизированное исследование ИИ в скрининге:

Метрика

ИИ‑поддержка

Двойное чтение без ИИ

Чувствительность

80,5%

73,8%

Специфичность

98,5%

98,5%

Ложноположительные

1,5%

1,4%

Интервальные раки на 1000

1,55

1,76

Раков найдено на скрининге

338 из 420

262 из 355

Специфичность 98,5%. Ровно та цифра, которую просил заказчик, и взята она не с отложенной выборки, а с боевого потока национальной программы.

Считаем, что за ней стоит. Здоровых в группе примерно 52 600. Полтора процента от них это около 790 женщин, которых вызвали зря. Раков на скрининге нашли 338. Значит, из примерно 1130 вызовов оправданными оказались 338, и это 30%.

Больше двух здоровых женщин на дообследовании за каждую найденную опухоль. При специфичности, которую заказчик считал синонимом «работает наверняка».

Метрика, которая это описывает, называется положительная прогностическая ценность, PPV. В немецком PRAIM на 463 094 женщинах, опубликованном в Nature Medicine, PPV отзыва вышел 17,9% в группе с ИИ против 14,9% в контроле. То есть там рак был у одной вызванной из шести. При этом PRAIM показал рост выявляемости с 5,7 до 6,7 случая на 1000 без роста отзывов, и для реальной программы это отличный результат.

Самое неинтуитивное в PPV то, что он зависит от распространенности болезни сильнее, чем от самой модели. Перенесите одну и ту же сеть со скрининга здоровых на поток симптомных пациентов, не тронув ни одного веса, и PPV изменится в разы.

Теперь про цену улучшения. Чтобы поднять PPV с 30% до 86%, специфичность должна дойти до 99,9%. В штуках это падение ложных срабатываний с 790 до полусотни, то есть в пятнадцать раз. Каждая следующая девятка после запятой стоит на порядок дороже предыдущей, и подкрутить ее порогом не выйдет: подняли порог, специфичность выросла, чувствительность просела, и модель начала пропускать опухоли. В MASAI это видно по интервальным ракам, тем, что вылезают между скринингами: 1,55 против 1,76 на 1000.

Поэтому целевую метрику мы формулируем до техзадания и до всяких сроков, и звучит она как «специфичность не ниже X при чувствительности не ниже Y на потоке с распространенностью Z». Если в ТЗ написано «точность 99%», метрику не считал никто.

Кстати, я сам первый раз считал такой проект неправильно. Не по незнанию формул, а по инерции: в промышленном CV распространенность дефекта на потоке бывает и пять процентов, и двадцать, там PPV ведет себя мирно и в голову не лезет. Медицина ломает эту привычку об колено на первом же расчете.

При этом работает оно уже неплохо

Легко скатиться в интонацию «ничего не выходит», а она была бы враньем.

FDA ведет публичный список медизделий с ИИ. К концу марта 2026 года в нем 1524 записи, из них 1164 радиологические, это 76%. В первом квартале 2026-го из 92 авторизаций 69 пришлось на радиологию. Картинка остается самой массовой ИИ‑задачей в медицине с огромным отрывом от всего остального.

В России на июнь 2026 года зарегистрировано 57 медизделий с ИИ, эта цифра прозвучала на форуме НОВАМЕД-2026: 41 изделие из реестра отечественного ПО, 11 вне его, 5 иностранных. Разница с американским списком в двадцать пять раз, и объясняется она размером рынка, стоимостью регистрации и тем, кто в итоге платит, а вовсе не уровнем инженеров.

Отдельная история Москва. Эксперимент по компьютерному зрению в лучевой диагностике идет с 2020 года, и по словам Собянина от 18 мая 2026 года через него за шесть лет прошло порядка 200 ИИ‑сервисов, из которых 67 доведены до регулярной практики. За 2024 год сервисы разобрали 4 млн снимков, за первый квартал 2026-го уже 2 млн. Насколько я знаю, это крупнейший в мире непрерывно работающий полигон такого рода, и ценна там даже не пропускная способность, а то, что вокруг нее выстроена методология приемки и мониторинга, которой раньше просто не существовало.

Две вехи, которые стоит держать в голове. В 2018 году FDA авторизовала IDx‑DR, нынешний LumineticsCore: система ставит заключение по диабетической ретинопатии сама, без офтальмолога в контуре, чувствительность 87,2%, специфичность 90,7%. В сентябре 2021-го Paige Prostate получила De Novo как первый ИИ в цифровой патологии: патологи с ней пропускали рак на биопсии простаты на 70% реже.

Так что вопрос «возможно ли вообще» закрыт лет семь назад. Интересное начинается там, где надо построить это самому.

Кто это будет размечать

Есть момент, который переворачивает представление о проекте у любого инженера, впервые попавшего в медицину. Он наступает, когда врач тычет курсором в область на КТ и говорит «вот тут», а ты смотришь в тот же экран и не видишь там ничего. Вообще ничего. Однородная серая каша, в которой человек с пятнадцатью годами практики видит структуру, а ты видишь шум.

Инженер медицинские данные не размечает. Совсем. Отличить постлучевой фиброз от рецидива, узловую гиперплазию от аденомы или артефакт движения от находки нельзя, не отучившись шесть лет плюс ординатура. Посадите на эту работу обычного аннотатора, и получите датасет, на котором сеть аккуратно выучит чужую некомпетентность и вынесет ее в прод.

Значит, размечает врач, и вариантов два.

Либо он делает это сам в специализированном инструменте, и вы платите за его часы. Либо он сидит рядом с инженером, инженер водит мышкой, врач говорит куда. Второй способ медленнее по объему, зато инженер за месяц такой работы начинает хоть немного понимать, на что смотрит, и потом на разборе ошибок модели от него есть польза. Мы обычно так и стартуем, а на первый способ переходим, когда протокол разметки устоялся.

Во что это встает, недавно посчитали в Кельне, и цифры там показательные.

Свежая работа команды из Кельна в Radiology: Artificial Intelligence от 24 июня 2026 года как раз меряла экспертное время на сегментацию: 1941 исследование КТ и МРТ по 1520 пациентам, 10 датасетов, 57 обученных моделей. Ручная сегментация почки заняла в среднем 5,6 минуты на случай, опухоли 4,09 минуты. Ставку радиолога авторы взяли по Бюро статистики труда США, 170,17 доллара в час.

Теперь возьмем что‑нибудь потяжелее почки, держа в голове эти два числа. Сегментация опухоли головного мозга в мультисеквенсной МРТ занимает у радиолога около часа на пациента. Один размеченный случай, соответственно, около 170 долларов чистого врачебного времени. Скромный датасет на 5000 случаев дает 5000 часов и примерно 850 тысяч долларов.

И это без консенсуса. Нормальный референсный стандарт собирают так: случай смотрят два‑три врача независимо, расхождения разбирает третий. Умножайте на три с лишним. Два с половиной миллиона, а модель еще не обучали.

Сверху накиньте на то, что часть разметки первого захода придется выкинуть. Протокол окажется кривым: кто‑то обводил по внешнему краю отека, кто‑то по контуру накопления контраста, договориться надо было до старта, а поняли вы это на пятисотом случае.

Бить эту стену в лоб, впрочем, не нужно. В той же кельнской работе эксперту давали не пустой срез, а предварительную сегментацию от модели, которую надо было поправить. Время на почку упало с 5,6 минуты до 0,56, то есть на 90,3%. На опухоли выигрыш скромнее, с 4,09 до 2,12 минуты, 48,2%.

Это обычный active learning loop, и нигде он не окупается так быстро, как в медицине, просто потому что час эксперта тут самый дорогой ресурс на проекте. Размечаем небольшую стартовую партию руками, обучаем черновую модель, дальше врач правит и подтверждает вместо того, чтобы рисовать с нуля, каждые N случаев переобучаемся. Отдельная приятная деталь: модель сама ранжирует, что показать врачу следующим, и он тратит время на неоднозначное вместо сотой подряд очевидной нормы.

В России ставка врача другая, но структура расходов та же, а узкое место жестче. Минздрав в 2026 году оценивал нехватку примерно в 23,3 тысячи врачей и 63,6 тысячи среднего персонала, рентгенологов в регионах не хватает особенно остро. Когда специалист в дефиците, задача не в том, чтобы оплатить его час. Задача в том, чтобы этот час вообще существовал, потому что он конкурирует с приемом, а прием всегда выигрывает.

А теперь плохая новость: врачи между собой не согласны

Вот тут ломается интуиция, привезенная из промышленного CV, и я осознал глубину этой поломки позорно поздно.

Когда мы учим детектор дефектов на конвейере, эталон объективен. Деталь либо бракованная, либо нет, в спорном случае ее можно разрезать и посмотреть. В медицине разметка это чужое мнение. А мнения расходятся, причем сильнее, чем принято думать.

В работе Elmore, опубликованной в JAMA в марте 2015 года, 115 практикующих патологов независимо смотрели набор из 240 биоптатов молочной железы. Согласие с эталонным консенсусным диагнозом составило 75,3%. Каждое четвертое заключение расходилось с эталоном, который сам был собран консенсусом трех экспертов. Лучше всего дело обстояло с инвазивной карциномой, хуже всего с атипией и протоковой карциномой in situ, то есть там, где от заключения зависит, будут человека оперировать или нет.

Меланома жестче. В исследовании 2017 года в BMJ патологи расходились в диагнозе меланоцитарных поражений средней части спектра больше чем в половине случаев. Точность относительно консенсусного эталона составила 25% для умеренно атипичных поражений, 40% для тяжело атипичных и меланомы in situ, 43% для ранней инвазивной меланомы. Тот же патолог, посмотрев тот же случай второй раз, нередко ставил другой диагноз.

В радиологии не радужнее. По данным European Radiology, парное согласие по категориям Lung‑RADS при скрининге рака легкого дает среднюю каппу 0,67, категории расходятся примерно в 29% пар чтения, и в 8% случаев это выливается в разную тактику ведения пациента. На уровне отдельного узла, а не всего исследования, согласие проваливается до каппы 0,12.

Теперь соберем это вместе с предыдущим разделом, и получится неприятная картинка. Вы платите два с половиной миллиона за разметку. Эталон, который вы за эти деньги покупаете, в четверти случаев спорный. Потолок качества модели ограничен сверху именно этим потолком, а не архитектурой сети и не размером батча.

Практическое следствие тут злое. Модель, показавшая 90% согласия с одним конкретным врачом, лучше врачей не стала. Она переобучилась на манеру этого врача и посыплется при смене разметчика. Так что референсный стандарт собирается консенсусом, процедура разрешения споров пишется до начала разметки, а не после первого скандала, и согласие между самими экспертами меряется и публикуется рядом с метриками модели. Без этого числа цифру качества нечем интерпретировать.

Где есть объективный якорь, за него надо хвататься обеими руками: гистология после операции, подтвержденный исход через год‑два наблюдения, результат другого исследования. Такой якорь дороже и медленнее, зато он не мнение.

Хотя и консенсусный эталон правдой не является. Это просто более устойчивое мнение, чем одиночное. Настоящую правду дает исход, а исход приходит через годы, и к тому моменту у вас давно сдан проект.

Модель выучила больницу

Допустим, вы прошли предыдущие два круга. Датасет собран, эталон устойчивый, метрика правильная. Сеть учится, лосс падает, на валидации красиво.

А потом вы везете ее в другую больницу.

Каноническая история тут это работа Zech и соавторов в PLOS Medicine за ноябрь 2018 года. Брали CNN для выявления пневмонии на рентгене грудной клетки, данных 158 323 снимка из трех учреждений. Выяснилось, что сеть уверенно определяет по снимку, из какой он больницы и даже из какого отделения. А поскольку распространенность пневмонии по больницам и отделениям разная, модель радостно использовала это как признак. В трех из пяти сравнений качество на снимках чужой больницы значимо падало.

Мистики тут ноль. Разные аппараты, разные протоколы съемки, разные ядра реконструкции, разные настройки постобработки, вшитые в изображение служебные маркеры, разная доля переносных снимков у лежачих. Сеть все это видит и использует, потому что градиентному спуску безразлично, какой признак приносит лосс.

Размер просадки хорошо виден по эксперименту из обзора Wu и соавторов в Nature Medicine. Они обучили DenseNet-121 на детекцию пневмоторакса отдельно на данных трех американских клиник и прогнали каждую модель по всем трем тестовым выборкам:

Обучали на

Тест SHC

Тест BIDMC

Тест NIH

SHC

0,903

0,870

0,852

BIDMC

0,827

0,892

0,839

NIH

0,779

0,759

0,883

Жирным своя площадка. Модель, обученная на данных NIH, теряет 0,10–0,12 AUC при переезде, и для скрининга это разница между «работает» и «сыплет ложными тревогами пачками».

Разбивка на train/val/test случайной выборкой из общего пула для медицинских данных поэтому бессмысленна. Делить надо по учреждениям и по моделям аппаратов, целиком, без пересечения пациентов между сплитами, и минимум одну площадку держать внешней, куда сеть не заглядывала ни разу. Полезная проверка перед обучением: попробуйте предсказать по картинке саму площадку. Получилось уверенно, значит в данных сидит артефакт, и модель обязательно им воспользуется.

Так вот, самое интересное в той же работе Wu не эксперимент, а статистика по одобренным устройствам. Из 130 медизделий с ИИ, которые FDA одобрила с января 2015 по декабрь 2020, проспективным исследованием сопровождались четыре. Остальные 126 проверялись исключительно ретроспективно, и ни одно из 54 высокорисковых устройств проспективной оценки не проходило. Мультицентровая оценка публично отражена у 37. У 59 в публичной сводке вообще нет размера выборки, а у тех 71, где он есть, медиана составляет 300 случаев.

Триста случаев. Медиана тестовой выборки для устройства, допущенного к работе с живыми пациентами.

Отдельно стоит вспомнить ковидный эпизод, потому что он показывает, как это выглядит в масштабе. Систематический обзор Roberts и соавторов в Nature Machine Intelligence прошел по 2212 работам про машинное обучение для диагностики и прогноза COVID-19 по рентгену и КТ. После отбора осталось 415, после оценки качества в обзор вошли 62. Пригодных для клиники не нашлось ни одной. Больше всего моделей полегло на составных датасетах, где снимки больных брали из одного источника, а здоровых из другого, и сеть прекрасно училась отличать источник.

На демо работало

Допустим, обошли и это. Модель обобщается, метрики честные, регуляторных вопросов пока не касаемся. Что происходит, когда она встречается с реальным потоком, отлично видно на чужом опыте.

Датские исследователи взяли четыре коммерческих ИИ‑инструмента для рентгена грудной клетки и сравнили их с 72 радиологами на 2040 последовательных снимках из четырех больниц. Результаты вышли в Radiology.

Чувствительность оказалась в приличном диапазоне: 72–91% для инфильтративных изменений, 63–90% для пневмоторакса, 62–95% для плеврального выпота. А вот ложноположительные подвели заметно. По инфильтративным изменениям у инструментов вышло 13,7–36,9% против 11,6% у радиологов, по пневмотораксу 1,1–2,4% против 0,2%, по выпоту 7,7–16,4% против 4,2%. На мелких находках чувствительность местами падала до девяти процентов, а специфичность резко проседала на снимках с четырьмя и более находками одновременно, то есть на самых тяжелых пациентах.

Объяснение авторов мне нравится своей приземленностью: радиолог видит клинический контекст, анамнез, прошлые снимки, результаты КТ, а модель видит пиксели текущего кадра. В медицине контекст часто и есть диагноз.

Второй сюжет не про картинки, зато идеально показывает разрыв между заявленным и полученным. Epic Sepsis Model, проприетарная модель предсказания сепсиса, стояла в сотнях американских больниц. Внешняя валидация в JAMA Internal Medicine на 27 697 пациентах и 38 455 госпитализациях дала AUC 0,63 при заявленных производителем 0,76–0,83. Чувствительность 33%, PPV 12%. Две трети сепсисов модель пропускала, из поднятых тревог оправданной была примерно каждая восьмая, и все это время она честно работала и генерировала алерты, на которые бегали живые медсестры.

Что происходит с изделиями после выпуска, показывает работа Lee и соавторов из Johns Hopkins в JAMA Health Forum от 22 августа 2025 года. Взяли 950 ИИ‑медизделий, авторизованных FDA до ноября 2024 года. Шестьдесят из них попали под отзыв, всего 182 события отзыва, и около 43% этих отзывов случились в течение первого года после авторизации. Устройства без клинической валидации отзывали заметно чаще тех, за которыми стояли хоть какие‑то испытания, ретроспективные или клинические.

Мониторинг дрейфа мы поэтому кладем в MVP, а не в бэклог второй очереди. Пишем распределение выходов модели по площадкам и по моделям аппаратов, ловим сдвиг раньше, чем его заметит врач, держим механизм отката на предыдущую версию весов. Обновление модели в медицине это не деплой контейнера, это изменение медизделия со всеми вытекающими, и вот про вытекающие дальше.

Прежде чем это увидит хоть один пациент

Тут коротко, иначе получится вторая статья.

В России диагностическое ПО с ИИ это медицинское изделие, и обращение незарегистрированных медизделий запрещено. Класс риска определяется по приказу Минздрава № 4н от 06.06.2012, шкала из четырех ступеней, и диагностика обычно уходит в верхнюю часть, а это полный цикл технических и клинических испытаний. Есть отраслевая серия ГОСТ Р 59921: общие положения, клиническая оценка, технические испытания, и серия продолжает пополняться, в 2025-м вышла одиннадцатая часть.

Про мониторинг стоит знать заранее, потому что он лезет в архитектуру. Росздравнадзор обновил порядок автоматической передачи данных о работе медизделий с ИИ в свою информационную систему, действие продлено до 31 декабря 2027 года. Производители и пользователи обязаны автоматически отдавать наименование изделия, регистрационный номер, область применения, количество проведенных исследований и результаты работы системы, на каждое изделие заводится отдельный электронный кабинет, а в новой редакции добавилось обязательное указание типа решения. Проще говоря, телеметрия из вашего продукта в надзорный орган проектируется до регистрации, а не прикручивается после.

В Евросоюзе контур двойной. Медизделие идет по MDR, ИИ‑система параллельно по AI Act, где ПО класса IIa и выше автоматически попадает в категорию высокого риска. Техническое досье аудируется дважды, по приложениям MDR и по приложению IV AI Act, а система менеджмента качества обязана доказывать не только безопасность и эффективность, но и управление данными, работу с предвзятостью, прозрачность и кибербезопасность.

А вот с датами там прямо сейчас происходит движение, и это стоит перепроверять перед тем, как строить план. 7 мая 2026 года Совет ЕС, Европарламент и Комиссия достигли предварительного соглашения по Digital Omnibus, которое переносит сроки для высокорисковых систем. Встроенный в продукты ИИ, включая медизделия, получает отсрочку с 2 августа 2027 года до 2 августа 2028-го, системы из Annex III до 2 декабря 2027-го. Мотив назвали честно: технические стандарты и руководства, по которым это все положено выполнять, к сроку не готовы, и штрафовать за несоблюдение несуществующих стандартов было бы странно.

Юридическую силу перенос получит только после формального принятия и публикации в Official Journal. На момент, когда я это пишу, публикации еще не было, ожидают ее до 2 августа 2026 года. Так что если вы читаете статью позже, дату надо проверить заново.

В США дорога через 510(k) или De Novo, и сколько это стоит, померили Boston Consulting Group вместе с UCLA Biodesign, опросив руководителей 102 компаний по 105 выведенным на рынок технологиям. Медиана для успешно прошедшего 510(k) вышла 3,1 млн долларов при разбросе половины случаев от 1,2 до 6,8 млн, для De Novo 5 млн. По времени медиана от концепции до решения агентства 31 месяц для 510(k) и 66 месяцев для De Novo. Отдельно по программным ИИ‑изделиям медиана от подачи до решения 142–151 день, но почти всегда прилетает запрос дополнительной информации, часы останавливаются, и реальные сроки растягиваются на пять‑девять месяцев.

А вот что там действительно полезно для инженера, так это финальное руководство FDA по PCCP от 4 декабря 2024 года. Predetermined Change Control Plan позволяет заранее описать в первичной заявке, какие изменения модели вы собираетесь вносить, как будете их валидировать и по каким критериям принимать, и потом катить обновления без новой заявки. Для ML‑продукта, который дообучается по мере накопления данных, это разница между живым продуктом и замороженной версией трехлетней давности. План управления изменениями поэтому проектируется вместе с архитектурой обучения, а не пишется юристами постфактум.

Три юрисдикции, три разных бюрократии, а требуют они по сути одного: обучение модели это меньшая часть проекта, большая часть это доказательства.

Отвечать все равно будет врач

Вице‑премьер Татьяна Голикова 1 мая 2026 года, во время визита в НМИЦ имени Алмазова, сформулировала это без всякой дипломатии: «За ошибку точно будет отвечать врач». Финальное решение остается за человеком, ИИ вспомогательное средство, менять законодательство в сторону признания ИИ субъектом ответственности никто не планирует.

Юридически это значит, что суд будет разбирать действия врача на соответствие обычной клинической практике. Механически принял рекомендацию модели, не сверив с клинической картиной, получай нарушение профессионального долга. Обоснованно не согласился с моделью и оказался прав, вопросов нет.

Из этой конструкции следуют вполне конкретные требования к продукту, причем к тем его частям, которые обычно проектируют последними.

Интерфейс обязан позволять врачу не согласиться легко и без трения, и кнопка «отклонить» с фиксацией причины тут важнее красивой тепловой карты. Каждое решение модели логируется вместе с версией весов, версией препроцессинга и входными данными, потому что через три года при разборе случая надо будет воспроизвести ровно то, что модель показала в тот день. И отдельная головная боль это автоматизационная предвзятость, когда врач перестает смотреть сам и подписывает предложенное. Худший из возможных сценариев, и ловится он только проспективными исследованиями с человеком в контуре.

Есть еще один слой, который живет до всякой модели. Сведения о здоровье это специальная категория персональных данных, плюс сверху лежит врачебная тайна. Обезличивание DICOM это не только вычистить теги: в пикселях попадаются вшитые надписи с фамилией, а по КТ головы реконструируется лицо. Периметр обработки проектируется первым, до первой строчки обучающего кода. И вот здесь on‑premise или edge‑контур оправдан по причине, которая к латенси отношения не имеет: данные физически не должны покидать учреждение. Мы вообще не любители тащить edge туда, где справился бы обычный облачный вызов, но с медицинскими данными ограничение приходит из закона, и спорить с ним архитектурой бессмысленно.

Семнадцать лет за счет бюджета

Остался последний вопрос, который в технических разборах пропускают, а он решает судьбу продукта надежнее качества модели. Кто платит.

Работа в NEJM AI прошла по национальной базе из 11 млрд страховых заявок в США за период с января 2018 по июнь 2023 года, чтобы посчитать реальную биллинговую активность медицинского ИИ. Нашлось 16 процедур с выделенными кодами CPT, причем 15 из них появились начиная с 2021 года. Больше тысячи заявок набрали четыре кода из шестнадцати. Планку в десять тысяч перешагнули две области: оценка коронарных артерий с 67 306 заявками и диагностика диабетической ретинопатии. Большинство ИИ‑кодов имеют статус Category III, а значит цены Medicare по ним просто нет.

Список FDA на момент того анализа был меньше нынешнего, но пропорция от этого не меняется. Сотни одобренных устройств и две ниши, где деньги реально ходят. Вот в этом зазоре между «технология работает» и «технология внедрена» и умирает большинство медицинских ИИ‑продуктов.

И тут я хочу рассказать историю, которая объясняет осторожность плательщиков лучше любых рассуждений.

Компьютерная детекция в маммографии, CAD, появилась задолго до нынешних сетей. Ее одобрили, включили в оплату, и к середине двухтысячных она применялась на большинстве скрининговых маммограмм в США, съедая больше 400 млн долларов в год. В 2015 году Lehman и соавторы опубликовали в JAMA Internal Medicine анализ 495 818 скринингов с CAD против 129 807 без него за 2003–2009 годы.

Выявляемость рака оказалась одинаковой. 4,1 на 1000 в обеих группах. Более того, у той подгруппы радиологов, которые читали и с CAD, и без, чувствительность с CAD была ниже. Авторы прямо написали, что оснований оплачивать CAD как способ улучшить скрининг нет.

Семнадцать лет оплаченного из бюджета внедрения технологии, которая не сдвинула ни один показатель. Когда я первый раз наткнулся на эту работу, у меня было отчетливое ощущение, что читаю про нас нынешних, только с задержкой на поколение. И с тех пор я регуляторов и страховщиков с их неторопливостью прекрасно понимаю: они это уже проходили, за наши с вами деньги.

Разница между CAD и нынешним поколением как раз в доказательствах. У MASAI рандомизация и 105 тысяч участниц. У PRAIM 463 тысячи женщин и проспективный дизайн. Такого уровня доказательности у CAD не было никогда.

Так когда

Одной даты тут нет, поэтому отвечу слоями.

Часть уже работает и оплачивается прямо сейчас. Триаж и приоритизация очереди чтения, где модель выталкивает наверх подозрение на пневмоторакс или внутричерепное кровоизлияние. Измерения и сегментация, где сеть считает объемы быстрее и стабильнее человека. Второе чтение в маммографическом скрининге. Автономный скрининг диабетической ретинопатии, единственная на сегодня по‑настоящему автономная ниша. Общее у них то, что либо человек остается в контуре, либо задача узкая, поток огромный, а цена ошибки контролируемая.

Ближайшие два‑четыре года это замена одного из двух читающих врачей в скрининговых программах. Британская EDITH именно это и проверяет: более 700 тысяч женщин, 30 площадок, пять конкурирующих ИИ‑систем, старт в апреле 2025-го. Двигает эту историю банальный кадровый голод. По цензу Royal College of Radiologists, опубликованному в июне 2025 года, дефицит консультантов клинической радиологии в Британии составляет 29% и вырастет до 39% к 2029 году, если ничего не менять. Причина расхождения там же в отчете: за 2024 год штат консультантов вырос на 4,2%, а количество выполненных КТ и МРТ на 8%. Ножницы разъезжаются сами, безо всякого злого умысла, и никакой набор в ординатуру их за пять лет не сведет.

Туда же в этот горизонт я кладу автономный отсев заведомой нормы на отдельных потоках рентгена. И расширение московской модели на регионы с проработкой тарификации, потому что без строчки в тарифе ОМС любое внедрение живет ровно до конца пилотного бюджета.

А сценарий «нейросеть ставит диагноз вместо врача» в общем виде не про ближайшее время, и упирается он совсем не в архитектуру модели. Детекция узла на КТ технически решена. Упирается все в PPV на редких событиях, в отсутствие устойчивого эталона для сложных случаев, в юридическую конструкцию, где отвечает человек, и в то простое обстоятельство, что диагноз это картинка плюс анамнез плюс лаборатория плюс динамика во времени. Модель, которая видит одни пиксели, ограничена структурно, и датское исследование показало это открытым текстом.

Компьютерное зрение в медицине давно возможно и давно работает. Скорость дальнейшего движения зависит не от того, насколько хороши сети, а от того, как быстро набираются доказательства, договариваются регуляторы и находятся плательщики. Цикл длиной в годы, и ускорить его инженерными средствами нельзя.

С чего мы начинаем такой проект

Осталось сложить все это в порядок действий. Примерно это я и проговариваю на первой встрече, когда медицинскую задачу приносят всерьез.

Начинаем с метрики, до бюджета и до сроков. Не «точность 99%», а специфичность при фиксированной чувствительности на потоке с известной распространенностью, плюс посчитанный PPV. Заказчик не может назвать распространенность в своем потоке, значит проект стартует с ее измерения, иначе непонятно, что оптимизировать.

Врача кладем в смету первым днем, а не «найдем консультанта потом». Конкретные часы конкретного специалиста в бюджете и в календаре, процедура разрешения расхождений написана до старта разметки, согласие между экспертами меряется и публикуется вместе с метриками модели. Разметку сразу строим петлей: стартовая партия руками, черновая модель, дальше врач правит предсказания вместо рисования с нуля, приоритет показа определяется неопределенностью модели. Кельнские цифры, минус 90% времени на простых структурах и минус 48% на сложных, того стоят.

Валидацию делим по учреждениям и моделям аппаратов, без пересечения пациентов, с внешней площадкой, куда модель не заглядывала. Мониторинг дрейфа, версионирование весов и препроцессинга, воспроизводимость каждого показанного врачу решения и механизм отката идут в MVP, а не в бэклог.

Регуляторный трек ведем параллельно разработке, потому что класс риска, состав испытаний и обязательная телеметрия в надзорный орган определяют архитектуру, а не наоборот. Периметр данных проектируем раньше всего остального, с проверкой вшитых в пиксели данных и с честным ответом на вопрос, что вообще можно вывезти за стены учреждения.

Задача решаемая, это давно не вопрос «умеем или нет». Вопрос в том, сколько времени и денег съедает доказательная часть, и на медицинских задачах она обходится кратно дороже самой модели. Тот, кто закладывает в план только обучение и инференс, ошибается в бюджете не на проценты, а в разы, и узнает об этом на стадии, когда отступать уже поздно.

Такие разборы между большими статьями мы с командой пишем в телеграм‑канале morana.log. Если жанр по душе, заходите.

ссылка на оригинал статьи https://habr.com/ru/articles/1063756/