VANTAGE-Bench: оценка разрыва инфраструктурного ИИ в моделях зрения и языка
🏗️ VANTAGE-Bench: авторы предлагают бенчмарк для оценки моделей зрения-языка в задачах «инфраструктурного ИИ» — когда анализ идет не с пользовательских видео, а с фиксированных камер: логистика, транспорт, умные пространства. Для девелопмента это близко к сценариям видеомониторинга площадок, эксплуатации объектов и журналирования событий.
Суть исследования: проверены 17 моделей без дообучения на 3 346 медиафайлах и нескольких типах задач: описание видео, локализация объектов, проверка событий, трекинг, пространственно-временная привязка. Научная новизна — единая оценка изображений и видео для фиксированных инфраструктурных камер, включая протокол трекинга в один проход.
📉 Вывод: отставание моделей не общее, а точечное. Сильнее всего проседают проверка событий, временная локализация и описание длинных видео; по 2D-локализации открытые модели местами конкурентны. Ограничение практическое: даже лучшие системы пока слабо держат длинный горизонт наблюдения, что важно для реального мониторинга объектов.
Первоисточник
Читать оригинал