URLs для парсинга

Тема в разделе "Решение различных задач по парсингу", создана пользователем iDobroslavin, 26 апр 2023.

Метки:
  1. iDobroslavin

    iDobroslavin New Member Пользователи

    Регистрация:
    18 апр 2023
    Сообщения:
    8
    Город:
    Москва
    На текущий момент я делаю так, чтобы получить данные с сайтов:
    1) запускаю "лягушку" (Frog Deo Spider), прогоняю сайт, далее
    2) сохраняю юрлы для необходимой категории сайта, например определённый бренд велосипедов,
    3) загоняю в ContentDownloader (CD) и парсю данные.

    Но вот в чём дело: при прохождении лягушкой больших сайтов, например veloskad.ru, даже моих 16 ГБ оперативки не хватает, да и времени это занимает очень много

    1) Есть ли способ оптимизировать этот процесс?
    2) Можно ли как-то собрать урлы только определённой категории сайта?
     
  2. masrub

    masrub Well-Known Member Пользователи

    Регистрация:
    29 июн 2018
    Сообщения:
    250
    1) Используйте CD для получения url ов, кто вам в этом мешает?
    2) Парсите товары из какой вам необходимо категории.
    Ну либо парсите sitemap.xml сайта на предмет товаров/категорий, но там бывает много мусора и не актуальных данных. Ссылки недоступны для гостей
     
    iDobroslavin нравится это.
  3. iDobroslavin

    iDobroslavin New Member Пользователи

    Регистрация:
    18 апр 2023
    Сообщения:
    8
    Город:
    Москва
    Спасибо. Видимо, нужно изучать материалы FAQ.
     
  4. iDobroslavin

    iDobroslavin New Member Пользователи

    Регистрация:
    18 апр 2023
    Сообщения:
    8
    Город:
    Москва
    Нужны актуальные данные.
     
  5. kagorec

    kagorec Администратор Команда форума Администратор

    Регистрация:
    3 янв 2011
    Сообщения:
    4.442
    Адрес:
    Latvia
    Без "лягушки" можно обойтись, в Content Downloader есть сканер который быстрее соберет товары по категориям
     
    iDobroslavin нравится это.

Поделиться этой страницей