Чем пользуюсь на проектах:
1. ScraperAPI - база.
Вытаскивает HTML, json или текст страницы. Работает надежно, справляется с ~95 задачами из 100 с первого раза. Подходит когда нужно на потоке скрейпить.2. Firecrawl - база с допами.
Вытаскивает HTML и markdown страниц. В целом делает то же самое, что и первый, но функциональностей больше: например, структурирование содержания страниц в определенной структуре на потоке (встроенная LLM со structured output) или мониторинг изменений на странице. Сервис - классная находка. Выбор сюда, если нужны шире функциональности или если прайс подходит больше.3. Browserless - когда другие сервисы бессильны.
На сложных кейсах лучше обходит защиты. Через browserql настраивается пошаговое прохождение поп-апов и прочего, что мешает дойти до контента. Муторно, но иногда безальтернативно.
Раньше базой был Apify. Прости дружище…
На данный момент он остался в каких-то старых сценариях и в тестах, когда нужно скрейпить какой-то конкретный источник, типа телеграма, гугла или линкедина. Но стал систематически проигрывать альтернативам.
Резюмирую: ScraperAPI / Firecrawl - дефолт, Browserless - fallback