Многоуровневое слияние признаков на основе Vision Transformer для многометочной классификации дефектов канализации
🧪 Исследование с arXiv посвящено автоматической классификации дефектов канализации по изображениям инспекций. Задача практическая: в таких данных на одном кадре может быть несколько типов повреждений, а модели должны работать не только точно, но и с приемлемой вычислительной нагрузкой для массовых обследований инфраструктуры.
Авторы предложили Sewer-Transformer-ML — иерархический Vision Transformer с многоуровневым слиянием признаков, а также две облегчённые архитектуры для ограниченных ресурсов. На тесте Sewer-ML базовая модель получила F2_CIW 65,68% и F1_Normal 92,68%; облегчённая Sewer-MobileNet-ML показала сопоставимый F2_CIW 65,73% при 17 млн параметров.
Научная новизна — в сравнении схем слияния признаков для многометочной диагностики: прямое объединение лучше сработало для Transformer-признаков, attention-механизм — для многомасштабных CNN. Ограничение очевидное: результаты привязаны к публичным наборам Sewer-ML и Sewer-Capsule; для внедрения нужны проверки на локальных данных инспекций.
Первоисточник
Читать оригинал