К ленте

PolyBridgeBench: бенчмарк мультимодальных больших языковых моделей для проектирования мостов на основе физики

arXiv cs.AI 22.09.2026 PAPER
🌉 PolyBridgeBench: авторы предлагают исполняемый бенчмарк для проверки мультимодальных больших языковых моделей в задаче проектирования мостов. Модель получает визуальную сцену и структурированные инженерные ограничения, после чего должна сгенерировать полную топологию: узлы, элементы и материалы. Суть исследования — не просто оценить «понимание картинки», а проверить, выдерживает ли сгенерированная конструкция динамическую физическую симуляцию. Перед запуском используются детерминированные проверки корректности, затем фиксируется функциональный успех, а при отказе модели дают визуальные данные неудачного прогона и ограниченный бюджет на исправление. Научная новизна — раздельная оценка валидности схемы, фактической несущей работоспособности и восстановления после ошибки. Эксперименты на 189 уровнях и шести моделях показали заметный разрыв между формальной корректностью и динамическим успехом. Ограничение: результаты чувствительны к бюджетам материалов и строгому сценарию повторной попытки.

Первоисточник

Читать оригинал