Библиотека на Rust для классификации PDF и извлечения текста без OCR. Определяет тип документа — текстовый, сканированный, графический или смешанный — за 10–50 мс, возвращая оценку уверенности и список страниц, которым OCR всё же нужен.
Извлечение учитывает позиции символов, шрифты и координаты, автоматически восстанавливая порядок чтения в многоколоночной вёрстке и поддерживая RTL. Результат конвертируется в Markdown: заголовки H1–H4, списки, блоки кода, таблицы, ссылки и разрывы страниц.
