Разбивка спарсенного контента

Тема в разделе "Решение различных задач по парсингу", создана пользователем Leshii, 3 апр 2012.

  1. Leshii

    Leshii New Member Пользователи

    Регистрация:
    3 апр 2012
    Сообщения:
    4
    Приветствую всех форумчан!
    Помогите пожалуйста решить проблемку с разбивкой текста на статьи.
    Что на входе:
    Текстовый файл с более чем 2000 русскоязычных статей.
    Формат файла:
    <h1>Заголовок</h1>
    <p>Статья ...</p>
    <h1>Заголовок</h1>
    <p>Статья ....</p>
    В теле статьи и в заголовках больше никаких тегов не используется.
    Что надо получить на выходе:
    1) Надо разбить входной файл на столько выходных файлов, сколько статей во входном (т.е. более 2000 файлов на выходе, по одной статье с заголовком в каждом выходном файле)
    2) Названиее каждого выходного файла - транслит заголовка статьи из этого файла

    Если это вообще возможно сделать, подскажите пожалуйста как.
     
  2. Valiks

    Valiks New Member Супер Модератор

    Регистрация:
    18 янв 2012
    Сообщения:
    554
    Адрес:
    Всё время в скэйпе
    Загрузить файл в программу, и задать через повторяющиеся границы настройки, которые бы отделили статьи друг от друга. Тут, если по простому,

    1. Заголовок: Начало границы парсинга можно задать <h1>, вторую границу </h1>. Должно разделиться.
    2. Статья <p> вторая граница </p><h1>
    3. Вывод через <CD_CYCLE_GRAN_ALL!>
    4. название файла надо задать через DOCSNAMES_ и <CD_CYCLE_GRAN_1!>
    5. Транслит как сделать, посмотрите Ссылки недоступны для гостей

    Однако, это не есть готовое решение, только схема, конкретно надо всё испробовать, должно на 95% работать.
     
  3. Leshii

    Leshii New Member Пользователи

    Регистрация:
    3 апр 2012
    Сообщения:
    4
    Что то не выходит (
    Для теста сделал входной файл:
    <h1>Заголовок-1</h1>
    <p>Статья-1</p>
    <h1>Заголовок-2</h1>
    <p>Статья-2</p>
    <h1>Заголовок-3</h1>
    <p>Статья-3</p>

    Настройки:
    Граница 1 <h1> </h1>
    Граница 2 <p> </p>
    Шаблон вывода - <CD_CYCLE_GRAN_ALL!>
    Чем разделять циклы - #13 DOCSNAMES_<CD_CYCLE_GRAN_1!>.txt

    На выходе получаю:
    Заголовок-1
    Статья-1
    DOCSNAMES_Заголовок-1
    Заголовок-2
    Заголовок-3.txtЗаголовок-2
    Статья-2
    DOCSNAMES_Заголовок-1
    Заголовок-2
    Заголовок-3.txtЗаголовок-3
    Статья-3
     
  4. Valiks

    Valiks New Member Супер Модератор

    Регистрация:
    18 янв 2012
    Сообщения:
    554
    Адрес:
    Всё время в скэйпе
    Что-то, кажется я неправильно понял задачу, наговорил, не то, что нужно. Вам необходимо взять Ссылки недоступны для гостей. Затем уже обрабатывать эти файлы в CD. Программ много, в том числе бесплатные.
     
  5. Leshii

    Leshii New Member Пользователи

    Регистрация:
    3 апр 2012
    Сообщения:
    4
    Спасибо за совет, наконец то получилось. Только намучился с поиском программы для разбивки. Хорошо бы вам включить этот функционал в Decorator например.
     
  6. Valiks

    Valiks New Member Супер Модератор

    Регистрация:
    18 янв 2012
    Сообщения:
    554
    Адрес:
    Всё время в скэйпе
    Дело в том, что эти задачи прекрасно решают другие программы. У нас основное внимание направлено на парсинг, а это задача импорта, как бы противоположно направленная. Насчёт Decorator-а автор сам решает, что в нём добавить, что убрать. Программа бесплатная. Вы изложите свои мысли в соответствующей ветке форума, Ссылки недоступны для гостей, человек он работящий, придёт время добавит, возможно и нечто такое в программу.
     
  7. Valiks

    Valiks New Member Супер Модератор

    Регистрация:
    18 янв 2012
    Сообщения:
    554
    Адрес:
    Всё время в скэйпе
    Говорил с автором. Такие возможности в программе не будут реализованы, задача совершенно противоположная основной задаче Content Downloader-а.
     

Поделиться этой страницей