TAPe+ML v3 на arXiv: превосходим SOTA в классификации, детекции и сегментации при <100 тыс. параметров

—

от автора

Мы опубликовали на arXiv статью TAPe+ML: A Compact Structured Representation for Multi-Task Computer Vision. В ней собраны результаты TAPe+ML v3 на задачах классификации, object detection, instance segmentation, индексации и поиска сцен в видео, а также в промышленном OOD-пилоте.

Статья на arXiv: TAPe+ML: A Compact Structured Representation for Multi-Task Computer Vision

Если вы впервые читаете о TAPe, можно начать с наших предыдущих материалов:

Ключевые результаты TAPe+ML v3

88,1% Top-1 на ImageNet-1k, 65,3 mAP50–95 в детекции COCO, 58,4 Mask mAP50–95 в COCO instance segmentation, 98,2% покрытия объектов масками на LVIS — при размере ядра модели менее 100 тыс. параметров.

TAPe+ML v3 объединяет классификацию, детекцию и сегментацию в одном компактном ядре. В представленных в статье сравнениях она превосходит крупные SOTA-модели по ключевым метрикам: RF-DETR и YOLO в детекции, RF-DETR-Seg и YOLO26-X-Seg в сегментации; на ImageNet-1k достигает уровня крупнейших foundation-моделей при разнице в параметрах на несколько порядков.

Что проверяли в статье

В статье собраны результаты на нескольких типах задач и наборах данных:

  • классификация: ImageNet-1k, ImageNet-ReaL, ImageNet-v2, ImageNet-R, ImageNet-Sketch, ObjectNet, Imagenette и MNIST;

  • object detection: COCO и RF100-VL;

  • instance segmentation: LVIS и COCO;

  • индексация и поиск смысловых сцен в видео;

  • промышленная OOD-задача: распознавание засорений руды на изображениях конвейерной ленты;

  • самообучение: эксперимент с DINO/iBOT на TAPe-данных;

  • автоаннотация и адаптация модели к новому домену;

  • локальное и edge-развёртывание компактного CV-контура.

В статье также есть прямое сравнение TAPe-данных с сырыми пикселями при одной и той же архитектуре и одинаковых условиях обучения.

Классификация: TAPe+ML v3 обходит SOTA-модели с миллиардами параметров

На ImageNet-1k TAPe+ML v3 получила 88,1% Top-1 accuracy при числе параметров менее 100 тысяч.

На наборах со сдвигом распределения результаты следующие:

Набор данных

Top-1 accuracy

ImageNet-1k

88,1%

ImageNet-ReaL

89,9%

ImageNet-R

90,3%

ImageNet-Sketch

75,8%

ObjectNet

78,6%

ImageNet-v2

80,2%

В Imagenette мы сравнивали TAPe-данные и сырые пиксели на одной и той же трехслойной CNN с примерно 516 тысячами параметров. Обучение проводилось на 10% набора без аугментации в течение 25 эпох.

Входные данные

Accuracy

TAPe-данные

92%

Сырые пиксели

47%

В задаче iBOT стандартная DINO на 9 тысячах и 120 тысячах изображений не сошлась: loss оставался примерно на уровне 2,7 и 2,46 соответственно. Та же архитектура на TAPe-данных достигла loss 0,406 уже на 9 тысячах примеров.

Детекция: выше RF-DETR и YOLO на COCO при <100 тыс. параметров

Для object detection использовали стандартный COCO train2017 / val2017 с 80 классами.

Финальная конфигурация TAPe+ML v3:

  • mAP50: 84,7%;

  • mAP50–95: 65,3%;

  • менее 100 тысяч параметров.

Для ориентира в статье приведены публичные результаты внешних моделей:

Модель

COCO mAP50

COCO mAP50–95

Число параметров

TAPe+ML v3

84,7

65,3

<0,1 млн

RF-DETR-2XL

78,5

60,1

126,9 млн

RF-DETR-M

73,6

54,7

33,7 млн

YOLO11-M

64,1

48,6

20,1 млн

Время inference TAPe+ML v3 на NVIDIA GTX 1070 Ti 8 GB в детекционном измерении составило 10,8 мс на кадр. В той же конфигурации для сравнения: YOLO26s — 12,3 мс, RF-DETR-Small — 41,0 мс.

Внешние результаты в таблице приведены для контекста. Они могут быть получены при отличающихся training и inference protocol; это отдельно отмечено в статье.

Сегментация: выше специализированных SOTA-сегментаторов в едином ядре

В TAPe+ML v3 сегментация встроена в общий контур. Модель сначала выделяет потенциальные границы, затем собирает их в замкнутые контуры, после чего объединяет внутренние области в итоговые сегменты.

Для COCO instance segmentation результаты следующие:

Модель

Mask mAP50

Mask mAP50–95

TAPe+ML v3

80,7

58,4

RF-DETR-Seg-2XL

73,1

49,9

YOLO26-X-Seg

71,6

46,8

Для оценки качества масок на LVIS в статье используются отдельные показатели: покрытие объектов масками и AP@75. Эти метрики нельзя напрямую сравнивать с COCO Mask AP, поэтому приводим их отдельно.

Метрика на LVIS

YOLO без обучения на LVIS

TAPe+ML до дополнительного обучения

TAPe+ML после дополнительного обучения

Объекты, покрытые масками

44%

97%

98,2%

Маски с IoU ≥ 0,75

21%

72%

74%

Средний Mask IoU

0,135

0,345

0,856

Итоговый показатель TAPe+ML по методологии LVIS составил 82,5 AP.

Видео и поиск сцен: TAPe разгромила DINOv2, HOG и optical flow по скорости, памяти и стабильности

В статье есть и наш эксперимент по разбиению видео на смысловые сцены. Для одного и того же фрагмента использовались одинаковый кластеризатор HDBSCAN и одинаковые параметры — менялось только представление данных.

TAPe индексирует один час видео за 10–11 секунд, занимает в индексе менее 1 МБ, а кластеризация занимает около 1 секунды.

В эксперименте с одинаковым HDBSCAN-кластеризатором и одинаковыми параметрами TAPe сравнивали с DINOv2, HOG, optical flow, гистограммами и другими методами. TAPe не только дала наиболее устойчивое разбиение на сцены с минимальным числом шумовых кластеров, но и радикально превзошла альтернативы по скорости и компактности.

Для сравнения, DINOv2 ViT-B/14 индексировала тот же час видео примерно за 5 220 секунд — примерно в 475 раз дольше, чем TAPe; кластеризация занимала около 21,5 секунды, то есть примерно в 21 раз дольше. HOG строил индекс около 530 секунд, а затем кластеризовал его примерно 2 226 секунд; optical flow требовал около 2 959 секунд на индексацию и до 8 739 секунд на кластеризацию. При этом HOG создавал индекс около 1,7 ГБ, а optical flow — до 3,2 ГБ, тогда как TAPe укладывалась менее чем в 1 МБ.

SOTA на каждой камере: TAPe+ML переносит компьютерное зрение на edge

TAPe+ML v3 рассчитана не только на benchmark’ы и серверный inference. Компактная архитектура позволяет переносить распознавание ближе к источнику данных: на локальный сервер, промышленный компьютер, камеру, робота, БПЛА или в изолированный корпоративный контур.

  • <32 КБ — сырые веса TAPe+ML v3;

  • ~10 МБ — текущий исполняемый on-premise-пакет со всеми библиотеками;

  • ~20 МБ — пиковая память всего pipeline при обработке кадра;

  • 10,8 мс на кадр – детекционный inference;

  • около 12 мс на изображение – полный pipeline: detection, classification, segmentation, post-processing

Текущая упаковка и расход рабочей памяти не являются для нас пределом оптимизации. Отдельный цикл работы по минимизации размера бинарника, зависимостей, буферов и активаций пока не проводился. То есть сама модель уже занимает десятки килобайт, а размер полного решения может быть дополнительно уменьшен при необходимости конкретного edge-сценария.

Итого:

  • не требуется отправлять весь видеопоток в облако;

  • решение можно принимать рядом с камерой или производственной линией;

  • уменьшаются задержка, сетевые затраты и зависимость от соединения;

  • проще развертывать систему в закрытом on-premise-контуре;

  • появляется возможность масштабировать CV по множеству физических точек: камерам, роботам, БПЛА и локальным серверам.

Параметры модели обычно указываются отдельно от рабочих активаций и размера программного пакета. Поэтому «модель меньше 100 КБ» не означает, что готовое приложение вместе с зависимостями обязано занимать столько же. Но даже с текущей упаковкой TAPe+ML остается компактным решением для локального и edge-развертывания.

Промышленный пилот: TAPe+ML более чем вдвое превзошла YOLO

Отдельный раздел статьи на arXiv мы посвятили задаче распознавания засорений руды на изображениях конвейерной ленты.

Исходный набор состоял из 30 изображений и двух классов. Это OOD-сценарий: объекты, освещение, фон и структура данных существенно отличаются от COCO.

Метод

Объём данных

Accuracy

YOLO26s

30 изображений

≈28%

TAPe+ML, обучение только головы

30 изображений

≈45%

TAPe+ML, адаптация backbone

30 изображений

≈65%

TAPe+ML, адаптация backbone

85 изображений

≈85%

TAPe+ML, адаптация backbone + NMS

500 изображений

85,7–96%

Этот пилот показывает кратное превосходство даже базовой TAPe+ML над YOLO в сложной промышленной OOD-задаче. На тех же 30 изображениях TAPe+ML с адаптацией backbone достигла около 65% accuracy против 28% у YOLO26s — более чем вдвое выше. При 85 изображениях результат вырос примерно до 85%, а при расширении выборки до 500 изображений и использовании NMS — до 85,7–96%.

В процессе мы также поняли, что для OOD-задач недостаточно просто подключить новую классификационную голову к уже готовой модели. Если исходный backbone сформирован на COCO-подобных объектах, он может быть смещен в сторону привычных классов — людей, автомобилей, животных и бытовых предметов. Для промышленного домена нужна адаптация самого представления и backbone.

Автоаннотация: от 20 кадров к рабочему датасету

Автоаннотация — отдельный режим работы TAPe+ML и часть ML-стенда. Она нужна, чтобы не размечать весь датасет вручную до начала обучения.

После ручной разметки упрощенную версию TAPe+ML можно быстро обучить на этом стартовом наборе. Затем модель проходит по остальным неразмеченным данным и предлагает детекции выше заданного порога уверенности.

Пользователь не обязан создавать всю разметку с нуля. Он может:

  • подтвердить предложенный объект;

  • исправить bounding box или маску;

  • изменить класс;

  • удалить ложное срабатывание;

  • добавить пропущенный объект.

Исправления используются в следующем цикле обучения. Модель получает больше примеров именно в сложных и неуверенных случаях, а эксперт постепенно переходит от ручного рисования аннотаций к проверке и корректировке результатов.

Нужный объем начальной разметки зависит от числа классов, вариативности объектов, условий съемки и требований к ошибкам. Но для прикладных пилотов такой режим позволяет получить первую рабочую версию без полного ручного датасета.

Автоаннотация особенно важна в промышленности. Там ручная разметка требует не только времени аннотатора, но и участия предметного эксперта, который может отличить дефект, засорение или критичное отклонение от допустимого состояния оборудования.

Вместо линейного процесса «сначала полностью размечаем датасет, потом начинаем ML-проект» получается итеративный путь. Это снижает стоимость подготовки данных и ускоряет переход от первых изображений заказчика к пилоту.

Где TAPe+ML заменяет тяжелый computer vision — от камер до производства, роботов и БПЛА (то есть везде)

TAPe+ML можно применять в задачах, где требуется находить, классифицировать, сегментировать или анализировать объекты и события на изображениях и видео:

  • робототехника: навигация, захват объектов, визуальная инспекция;

  • БПЛА и спутниковые данные: поиск аномалий, мониторинг и инспекция инфраструктуры;

  • промышленность: дефекты, комплектация, конвейеры, контроль качества и безопасности;

  • транспорт и логистика: грузы, парковки, дорожная ситуация, маркировка и сортировка;

  • видеоаналитика: периметр, доступ, поиск событий, видеоархивы;

  • ритейл и e-commerce: полки, наличие товара, ценники, выкладка, предотвращение потерь;

  • агро: мониторинг полей, болезни растений, контроль техники;

  • медицина: поиск патологий и сегментация анатомических структур;

  • городская инфраструктура: дороги, повреждения, стройки, парковки и контроль требований безопасности.

Если вы работаете с классификацией, детекцией, сегментацией, видеоаналитикой, edge-развертыванием или разметкой данных – пишите в комментариях, личные сообщения или на почту tape@comexp.net.

Статья: TAPe+ML: A Compact Structured Representation for Multi-Task Computer Vision

Проект: ml.comexp.net

ссылка на оригинал статьи https://habr.com/ru/articles/1086426/