LingBot-Map — это потоковая модель 3D-реконструкции на основе архитектуры Geometric Context Transformer. Она объединяет привязку координат, геометрические подсказки и коррекцию дрейфа в едином фреймворке.
Модель работает в режиме потокового инференса ~20 FPS при разрешении 518×378 и поддерживает последовательности длиной свыше 10 000 кадров. Используется постраничный KV-кэш на базе FlashInfer для эффективной работы с памятью.
Доступны три чекпоинта: lingbot-map-long для длинных сцен, lingbot-map для сбалансированной работы и lingbot-map-stage1 для двунаправленного инференса. Бенчмарки охватывают KITTI, ETH3D, TUM, 7-scenes и другие датасеты.
GitHub ★ 7,963

0 комментариев