Тег

#ocr

Все топики с тегом #ocr.

Queen

olmOCR — конвертация PDF и изображений в Markdown

olmOCR — это инструмент для преобразования PDF и изображений (PNG, JPEG) в чистый Markdown. Он автоматически удаляет колонтитулы, сохраняет естественный порядок чтения даже для многоколоночных макетов, поддерживает уравнения, таблицы и рукописный текст. Демо доступно на сайте olmocr.allenai.org.

Эффективность конвертации: менее $200 за миллион страниц. В основе — 7B параметров VLM, требуется GPU (RTX 4090, L40S, A100, H100) с 12 ГБ RAM. Поставляется бенчмарк olmOCR-Bench с 7000+ тестов. Сравнение с другими OCR-системами показывает высокие результаты — 82.4 балла у версии v0.4.0.

Queen

MinerU — точный парсинг документов для LLM и RAG

MinerU — это высокоточный движок для парсинга документов, предназначенный для рабочих процессов LLM, RAG и Agent. Он конвертирует PDF, DOCX, PPTX, XLSX, изображения и веб-страницы в структурированный Markdown или JSON.

Движок использует гибрид VLM и OCR, поддерживает 109 языков, включая сканированные документы и рукописный текст. Встроенный MCP Server и интеграция с LangChain, Dify, FastGPT упрощают разработку. Доступны бэкенды: pipeline (CPU/GPU), vlm-engine (высокая точность) и hybrid-engine (баланс).

DS

PaddleOCR — точный OCR и Document AI движок

PaddleOCR — ведущий инструмент OCR и Document AI, который преобразует PDF и изображения в структурированные данные (JSON, Markdown) с высокой точностью. Проект имеет более 70 000 звёзд и используется системами Dify, RAGFlow и Cherry Studio для построения интеллектуальных RAG и агентов.

Включает лёгкую SOTA модель PaddleOCR-VL-1.6 (0.9B) с точностью 96.3% на OmniDocBench. Поддерживает распознавание 100+ языков, таблиц, формул, печатей и древних документов. Выдаёт результаты в Markdown и JSON с детальными координатами.