Готовый парсер каталога на Python. Забирает с сайта товары, цены, остатки, характеристики и ссылки на фото, складывает всё в Excel или CSV.
Что внутри:
— настройка через один файл конфигурации: адрес каталога, какие поля собирать, куда сохранять;
— асинхронный сбор в несколько потоков, с ограничением частоты запросов;
— инкрементальный режим: при повторном запуске забираются только новые и изменившиеся позиции, а не весь каталог заново;
— поддержка прокси с ротацией, задаются списком в конфиге;
— запуск по расписанию и лог каждого прогона: сколько собрано, что пропущено и почему;
— отчёт о завершении в Telegram, если нужно.
Что вы получаете: исходники, файл конфигурации с комментариями на русском и инструкцию по запуску на компьютере или на сервере.
Честно о границах: универсального парсера «под все сайты» не бывает. Код рассчитан на каталоги с обычной постраничной выдачей, и под конкретный сайт правятся селекторы — это несложно, и в инструкции показано, как. Если сайт защищён антиботом, нужны мобильные прокси и отдельная доработка, цена которой указана рядом.
Код написан мной, к клиентским проектам отношения не имеет.