IFCMemoryBench: оценка долговременной памяти агентов на базе LLM в извлечении информации BIM
🧠 IFCMemoryBench: авторы из arXiv предлагают проверять долговременную память LLM-агентов не на пересказе диалогов, а в рабочем BIM-сценарии: агенту нужно отвечать на вопросы по IFC-модели, используя контекст из прошлых сессий — спецификации проекта, решения заказчика и инженерные договорённости, которых нет в самой модели.
В бенчмарке 143 многосессионные задачи по 19 проектам и 4 016 предыдущих сессий. Оценка разделяет три этапа: загрузку знаний в память, поиск нужного контекста и его использование вместе с живыми запросами к IFC. Научная новизна здесь — в связке диалоговой памяти агента со структурированными BIM-данными, а не с абстрактной перепиской.
Результат сдержанный: лучшая система дала 32,4% точности в реалистичном режиме загрузки и меньше 60% даже при упрощённых условиях. Ограничение текущих подходов — память часто находит тематически близкие фрагменты, но хранит проектные знания неполно и разрозненно.
Первоисточник
Читать оригинал