Двухэтапный парсинг
Для одного из проектов мне потребовалось спарсить огромное количество страниц. Но вот незадача — в процессе парсинг сломался, и большая часть данных в итоге оказалась с ошибками.
После этого я пришёл к двухэтапной модели.
Сначала просто скачиваем HTML и сохраняем его как есть. А уже на следующем этапе разбираем эти HTML и складываем полученные данные в MySQL.
Так гораздо проще. Если HTML уже скачан, не нужно снова идти на сайт и перекачивать тысячи страниц. Достаточно поправить код и заново прогнать второй этап.
Или, например, если позже понадобилось добрать какую-то информацию. Допустим, у страниц были теги, которые при первичном парсинге я не захватил. В этом случае опять же достаточно пройтись по уже сохранённому HTML.
Особенно удобно это становится, когда сайт имеет динамическую разметку или структура страниц периодически меняется.
В итоге получается довольно простой и надёжный процесс:
Скачал → сохранил HTML → разобрал → сохранил в БД.
И чем больше данных нужно обработать, тем больше мне нравится такой подход.
парсинг