Мы опубликовали на arXiv статью TAPe+ML: A Compact Structured Representation for Multi-Task Computer Vision. В ней собраны результаты TAPe+ML v3 на задачах классификации, object detection, instance segmentation, индексации и поиска сцен в видео, а также в промышленном OOD-пилоте.
Статья на arXiv: TAPe+ML: A Compact Structured Representation for Multi-Task Computer Vision
Если вы впервые читаете о TAPe, можно начать с наших предыдущих материалов:
Ключевые результаты TAPe+ML v3
88,1% Top-1 на ImageNet-1k, 65,3 mAP50–95 в детекции COCO, 58,4 Mask mAP50–95 в COCO instance segmentation, 98,2% покрытия объектов масками на LVIS — при размере ядра модели менее 100 тыс. параметров.
TAPe+ML v3 объединяет классификацию, детекцию и сегментацию в одном компактном ядре. В представленных в статье сравнениях она превосходит крупные SOTA-модели по ключевым метрикам: RF-DETR и YOLO в детекции, RF-DETR-Seg и YOLO26-X-Seg в сегментации; на ImageNet-1k достигает уровня крупнейших foundation-моделей при разнице в параметрах на несколько порядков.
Что проверяли в статье
В статье собраны результаты на нескольких типах задач и наборах данных:
-
классификация: ImageNet-1k, ImageNet-ReaL, ImageNet-v2, ImageNet-R, ImageNet-Sketch, ObjectNet, Imagenette и MNIST;
-
object detection: COCO и RF100-VL;
-
instance segmentation: LVIS и COCO;
-
индексация и поиск смысловых сцен в видео;
-
промышленная OOD-задача: распознавание засорений руды на изображениях конвейерной ленты;
-
самообучение: эксперимент с DINO/iBOT на TAPe-данных;
-
автоаннотация и адаптация модели к новому домену;
-
локальное и edge-развёртывание компактного CV-контура.
В статье также есть прямое сравнение TAPe-данных с сырыми пикселями при одной и той же архитектуре и одинаковых условиях обучения.
Классификация: TAPe+ML v3 обходит SOTA-модели с миллиардами параметров
На ImageNet-1k TAPe+ML v3 получила 88,1% Top-1 accuracy при числе параметров менее 100 тысяч.
На наборах со сдвигом распределения результаты следующие:
|
Набор данных |
Top-1 accuracy |
|---|---|
|
ImageNet-1k |
88,1% |
|
ImageNet-ReaL |
89,9% |
|
ImageNet-R |
90,3% |
|
ImageNet-Sketch |
75,8% |
|
ObjectNet |
78,6% |
|
ImageNet-v2 |
80,2% |
В Imagenette мы сравнивали TAPe-данные и сырые пиксели на одной и той же трехслойной CNN с примерно 516 тысячами параметров. Обучение проводилось на 10% набора без аугментации в течение 25 эпох.
|
Входные данные |
Accuracy |
|---|---|
|
TAPe-данные |
92% |
|
Сырые пиксели |
47% |
В задаче iBOT стандартная DINO на 9 тысячах и 120 тысячах изображений не сошлась: loss оставался примерно на уровне 2,7 и 2,46 соответственно. Та же архитектура на TAPe-данных достигла loss 0,406 уже на 9 тысячах примеров.
Детекция: выше RF-DETR и YOLO на COCO при <100 тыс. параметров
Для object detection использовали стандартный COCO train2017 / val2017 с 80 классами.
Финальная конфигурация TAPe+ML v3:
-
mAP50: 84,7%;
-
mAP50–95: 65,3%;
-
менее 100 тысяч параметров.
Для ориентира в статье приведены публичные результаты внешних моделей:
|
Модель |
COCO mAP50 |
COCO mAP50–95 |
Число параметров |
|---|---|---|---|
|
TAPe+ML v3 |
84,7 |
65,3 |
<0,1 млн |
|
RF-DETR-2XL |
78,5 |
60,1 |
126,9 млн |
|
RF-DETR-M |
73,6 |
54,7 |
33,7 млн |
|
YOLO11-M |
64,1 |
48,6 |
20,1 млн |
Время inference TAPe+ML v3 на NVIDIA GTX 1070 Ti 8 GB в детекционном измерении составило 10,8 мс на кадр. В той же конфигурации для сравнения: YOLO26s — 12,3 мс, RF-DETR-Small — 41,0 мс.
Внешние результаты в таблице приведены для контекста. Они могут быть получены при отличающихся training и inference protocol; это отдельно отмечено в статье.
Сегментация: выше специализированных SOTA-сегментаторов в едином ядре
В TAPe+ML v3 сегментация встроена в общий контур. Модель сначала выделяет потенциальные границы, затем собирает их в замкнутые контуры, после чего объединяет внутренние области в итоговые сегменты.
Для COCO instance segmentation результаты следующие:
|
Модель |
Mask mAP50 |
Mask mAP50–95 |
|---|---|---|
|
TAPe+ML v3 |
80,7 |
58,4 |
|
RF-DETR-Seg-2XL |
73,1 |
49,9 |
|
YOLO26-X-Seg |
71,6 |
46,8 |
Для оценки качества масок на LVIS в статье используются отдельные показатели: покрытие объектов масками и AP@75. Эти метрики нельзя напрямую сравнивать с COCO Mask AP, поэтому приводим их отдельно.
|
Метрика на LVIS |
YOLO без обучения на LVIS |
TAPe+ML до дополнительного обучения |
TAPe+ML после дополнительного обучения |
|---|---|---|---|
|
Объекты, покрытые масками |
44% |
97% |
98,2% |
|
Маски с IoU ≥ 0,75 |
21% |
72% |
74% |
|
Средний Mask IoU |
0,135 |
0,345 |
0,856 |
Итоговый показатель TAPe+ML по методологии LVIS составил 82,5 AP.
Видео и поиск сцен: TAPe разгромила DINOv2, HOG и optical flow по скорости, памяти и стабильности
В статье есть и наш эксперимент по разбиению видео на смысловые сцены. Для одного и того же фрагмента использовались одинаковый кластеризатор HDBSCAN и одинаковые параметры — менялось только представление данных.
TAPe индексирует один час видео за 10–11 секунд, занимает в индексе менее 1 МБ, а кластеризация занимает около 1 секунды.
В эксперименте с одинаковым HDBSCAN-кластеризатором и одинаковыми параметрами TAPe сравнивали с DINOv2, HOG, optical flow, гистограммами и другими методами. TAPe не только дала наиболее устойчивое разбиение на сцены с минимальным числом шумовых кластеров, но и радикально превзошла альтернативы по скорости и компактности.
Для сравнения, DINOv2 ViT-B/14 индексировала тот же час видео примерно за 5 220 секунд — примерно в 475 раз дольше, чем TAPe; кластеризация занимала около 21,5 секунды, то есть примерно в 21 раз дольше. HOG строил индекс около 530 секунд, а затем кластеризовал его примерно 2 226 секунд; optical flow требовал около 2 959 секунд на индексацию и до 8 739 секунд на кластеризацию. При этом HOG создавал индекс около 1,7 ГБ, а optical flow — до 3,2 ГБ, тогда как TAPe укладывалась менее чем в 1 МБ.
SOTA на каждой камере: TAPe+ML переносит компьютерное зрение на edge
TAPe+ML v3 рассчитана не только на benchmark’ы и серверный inference. Компактная архитектура позволяет переносить распознавание ближе к источнику данных: на локальный сервер, промышленный компьютер, камеру, робота, БПЛА или в изолированный корпоративный контур.
-
<32 КБ — сырые веса TAPe+ML v3;
-
~10 МБ — текущий исполняемый on-premise-пакет со всеми библиотеками;
-
~20 МБ — пиковая память всего pipeline при обработке кадра;
-
10,8 мс на кадр – детекционный inference;
-
около 12 мс на изображение – полный pipeline: detection, classification, segmentation, post-processing
Текущая упаковка и расход рабочей памяти не являются для нас пределом оптимизации. Отдельный цикл работы по минимизации размера бинарника, зависимостей, буферов и активаций пока не проводился. То есть сама модель уже занимает десятки килобайт, а размер полного решения может быть дополнительно уменьшен при необходимости конкретного edge-сценария.
Итого:
-
не требуется отправлять весь видеопоток в облако;
-
решение можно принимать рядом с камерой или производственной линией;
-
уменьшаются задержка, сетевые затраты и зависимость от соединения;
-
проще развертывать систему в закрытом on-premise-контуре;
-
появляется возможность масштабировать CV по множеству физических точек: камерам, роботам, БПЛА и локальным серверам.
Параметры модели обычно указываются отдельно от рабочих активаций и размера программного пакета. Поэтому «модель меньше 100 КБ» не означает, что готовое приложение вместе с зависимостями обязано занимать столько же. Но даже с текущей упаковкой TAPe+ML остается компактным решением для локального и edge-развертывания.
Промышленный пилот: TAPe+ML более чем вдвое превзошла YOLO
Отдельный раздел статьи на arXiv мы посвятили задаче распознавания засорений руды на изображениях конвейерной ленты.
Исходный набор состоял из 30 изображений и двух классов. Это OOD-сценарий: объекты, освещение, фон и структура данных существенно отличаются от COCO.
|
Метод |
Объём данных |
Accuracy |
|---|---|---|
|
YOLO26s |
30 изображений |
≈28% |
|
TAPe+ML, обучение только головы |
30 изображений |
≈45% |
|
TAPe+ML, адаптация backbone |
30 изображений |
≈65% |
|
TAPe+ML, адаптация backbone |
85 изображений |
≈85% |
|
TAPe+ML, адаптация backbone + NMS |
500 изображений |
85,7–96% |
Этот пилот показывает кратное превосходство даже базовой TAPe+ML над YOLO в сложной промышленной OOD-задаче. На тех же 30 изображениях TAPe+ML с адаптацией backbone достигла около 65% accuracy против 28% у YOLO26s — более чем вдвое выше. При 85 изображениях результат вырос примерно до 85%, а при расширении выборки до 500 изображений и использовании NMS — до 85,7–96%.
В процессе мы также поняли, что для OOD-задач недостаточно просто подключить новую классификационную голову к уже готовой модели. Если исходный backbone сформирован на COCO-подобных объектах, он может быть смещен в сторону привычных классов — людей, автомобилей, животных и бытовых предметов. Для промышленного домена нужна адаптация самого представления и backbone.
Автоаннотация: от 20 кадров к рабочему датасету
Автоаннотация — отдельный режим работы TAPe+ML и часть ML-стенда. Она нужна, чтобы не размечать весь датасет вручную до начала обучения.
После ручной разметки упрощенную версию TAPe+ML можно быстро обучить на этом стартовом наборе. Затем модель проходит по остальным неразмеченным данным и предлагает детекции выше заданного порога уверенности.
Пользователь не обязан создавать всю разметку с нуля. Он может:
-
подтвердить предложенный объект;
-
исправить bounding box или маску;
-
изменить класс;
-
удалить ложное срабатывание;
-
добавить пропущенный объект.
Исправления используются в следующем цикле обучения. Модель получает больше примеров именно в сложных и неуверенных случаях, а эксперт постепенно переходит от ручного рисования аннотаций к проверке и корректировке результатов.
Нужный объем начальной разметки зависит от числа классов, вариативности объектов, условий съемки и требований к ошибкам. Но для прикладных пилотов такой режим позволяет получить первую рабочую версию без полного ручного датасета.
Автоаннотация особенно важна в промышленности. Там ручная разметка требует не только времени аннотатора, но и участия предметного эксперта, который может отличить дефект, засорение или критичное отклонение от допустимого состояния оборудования.
Вместо линейного процесса «сначала полностью размечаем датасет, потом начинаем ML-проект» получается итеративный путь. Это снижает стоимость подготовки данных и ускоряет переход от первых изображений заказчика к пилоту.
Где TAPe+ML заменяет тяжелый computer vision — от камер до производства, роботов и БПЛА (то есть везде)
TAPe+ML можно применять в задачах, где требуется находить, классифицировать, сегментировать или анализировать объекты и события на изображениях и видео:
-
робототехника: навигация, захват объектов, визуальная инспекция;
-
БПЛА и спутниковые данные: поиск аномалий, мониторинг и инспекция инфраструктуры;
-
промышленность: дефекты, комплектация, конвейеры, контроль качества и безопасности;
-
транспорт и логистика: грузы, парковки, дорожная ситуация, маркировка и сортировка;
-
видеоаналитика: периметр, доступ, поиск событий, видеоархивы;
-
ритейл и e-commerce: полки, наличие товара, ценники, выкладка, предотвращение потерь;
-
агро: мониторинг полей, болезни растений, контроль техники;
-
медицина: поиск патологий и сегментация анатомических структур;
-
городская инфраструктура: дороги, повреждения, стройки, парковки и контроль требований безопасности.
Если вы работаете с классификацией, детекцией, сегментацией, видеоаналитикой, edge-развертыванием или разметкой данных – пишите в комментариях, личные сообщения или на почту tape@comexp.net.
Статья: TAPe+ML: A Compact Structured Representation for Multi-Task Computer Vision
Проект: ml.comexp.net
ссылка на оригинал статьи https://habr.com/ru/articles/1086426/