Название файла спарсенной страницы по регулярному выражению

Тема в разделе "Решение различных задач по парсингу", создана пользователем Vestmar, 12 фев 2015.

  1. Vestmar

    Vestmar New Member Пользователи

    Регистрация:
    22 мар 2014
    Сообщения:
    21
    добрый день! Задача уже почти решена осталось малое,
    весь код парсинга вот [HTMTOTXT:a,p,h1,h2,h3,h4,li,table,tr,th,div,ul,ol][DOCSOURCE][/HTMTOTXT] понял что мне проще спасить так, а потом пыхой почистить, у меня большая просьба! Составьте пожалуйста условие в этого кода что бы названия для сохраненного файла бралось из урла регуляркой,
    (viagra|levita|cialis|и тд) если слово присутствует в урле то сохраняется viagra1.txt viagra2.txt и тд, если нет про просто по счету фаил 1542.txt это реально?
     
  2. Vestmar

    Vestmar New Member Пользователи

    Регистрация:
    22 мар 2014
    Сообщения:
    21
    я понял это через DOCSNAMES_ можно) Буду очень признателен!

    да и урлы для парсинга без [МАКРОСОВ] простые http : //www. medicinenet.com/bupropion-oral/article.htm <- типо вот)
     
    Последнее редактирование: 12 фев 2015
  3. Vestmar

    Vestmar New Member Пользователи

    Регистрация:
    22 мар 2014
    Сообщения:
    21
    Вот кому нужен ответ, пусть кривой но пофиг, остальное на php всё можно сделать обыкновенным циклом, DOCSNAMES_[FIRST_REPLACE(re:[^a-zа-яA-ZА-Я0-9\.\!\,\?\n\r -\)\(]| {break}re:([\t\s]{2,100})| )]<CD_DOCURL!>[/FIRST_REPLACE]__[INT_ID2].txt
     
  4. Vestmar

    Vestmar New Member Пользователи

    Регистрация:
    22 мар 2014
    Сообщения:
    21
    xD там смаил оплучился) r e : (
     

Поделиться этой страницей