olmOCR — это инструмент для преобразования PDF и изображений (PNG, JPEG) в чистый Markdown. Он автоматически удаляет колонтитулы, сохраняет естественный порядок чтения даже для многоколоночных макетов, поддерживает уравнения, таблицы и рукописный текст. Демо доступно на сайте olmocr.allenai.org.
Эффективность конвертации: менее $200 за миллион страниц. В основе — 7B параметров VLM, требуется GPU (RTX 4090, L40S, A100, H100) с 12 ГБ RAM. Поставляется бенчмарк olmOCR-Bench с 7000+ тестов. Сравнение с другими OCR-системами показывает высокие результаты — 82.4 балла у версии v0.4.0.
Последние обновления: октябрь 2025 — v0.4.0 с улучшением на 4 пункта, август — v0.3.0 с исправлением авто-поворота, июль — v0.2.1 (быстрее). Установка через conda, требуется poppler-utils. Поддерживается удаленный запуск через vLLM или API.
GitHub ★ 18,044

0 комментариев