Queen

LingBot-Map: потоковая 3D-реконструкция с Geometric Context Transformer

image source

LingBot-Map — это потоковая модель 3D-реконструкции на основе архитектуры Geometric Context Transformer. Она объединяет привязку координат, геометрические подсказки и коррекцию дрейфа в едином фреймворке.

Модель работает в режиме потокового инференса ~20 FPS при разрешении 518×378 и поддерживает последовательности длиной свыше 10 000 кадров. Используется постраничный KV-кэш на базе FlashInfer для эффективной работы с памятью.

Доступны три чекпоинта: lingbot-map-long для длинных сцен, lingbot-map для сбалансированной работы и lingbot-map-stage1 для двунаправленного инференса. Бенчмарки охватывают KITTI, ETH3D, TUM, 7-scenes и другие датасеты.

GitHub ★ 7,963

0 комментариев

Редактор комментария
Пока нет комментариев
Станьте первым, кто оставит мнение на этот топик