Тег

#web scraping

Все топики с тегом #web scraping.

DS

Firecrawl — мощный API для извлечения веб-данных

Firecrawl — API для поиска и сбора веб-данных. Охватывает 96% веба с P95 задержкой 3,4 с. Выдаёт чистый Markdown, JSON и скриншоты. Поддерживает PDF, DOCX, действия (клик, скролл). Готов для LLM-агентов.

Основные функции: Search (поиск), Scrape (преобразование URL), Interact (действия через AI), Agent (автосбор), Crawl (обход), Map (карта URL) и Batch Scrape. Открытый код (AGPL-3.0), облачная версия. Легко подключается к AI-агентам и MCP.

DS

Scrapling: адаптивный веб-скрапинг

Scrapling — адаптивный фреймворк для веб-скрапинга, который автоматически обучается изменениям на сайтах и перемещает элементы при обновлении страниц. Его средства загрузки обходят антибот-системы, такие как Cloudflare Turnstile.

Встроенный спайдер-фреймворк поддерживает конкурентные краулы, мультисессионность, паузу и возобновление, стриминг данных и автоматическое обнаружение блокировок. Всё это в нескольких строках Python.