Как создать парсер текста?

  • Автор темы Автор темы Nixens
  • Дата начала Дата начала

Nixens

Client
Регистрация
18.02.2018
Сообщения
288
Реакции
7
Баллы
18
Хочу сделать парсер, который будет парсить просто текст со страницы.
Обычный структурированный текст, без тегов и пр. Просто текст. Как сделать? У меня получаются огромные нагромождения, может есть универсальная регулярка под такие случаи?
Просто, есть статья - 15 лайфхаков для жизни. Хочу получить её текст.
 
Хочу сделать парсер, который будет парсить просто текст со страницы.
Обычный структурированный текст, без тегов и пр. Просто текст. Как сделать? У меня получаются огромные нагромождения, может есть универсальная регулярка под такие случаи?
Было что то на эту тему на форуме, попробуйте поискать.
А пока можете попробовать работу этой регулярки: (\b[A-ZА-Я](?:\w+[,;:]?\s+){3,}\w{2,}[.!?])
 
  • Оценить
Реакции: udder и Nixens
Хочу сделать парсер, который будет парсить просто текст со страницы.
Если хотите научиться парсить, посмотрите готовые бесплатные проекты и конкурсные статьи/шаблоны, там были конкретные примеры, а так же рекомендуется использовать xpath вместо регулярок.
 
  • Оценить
Реакции: Nixens
Было что то на эту тему на форуме, попробуйте поискать.
А пока можете попробовать работу этой регулярки: (\b[A-ZА-Я](?:\w+[,;:]?\s+){3,}\w{2,}[.!?])
попробовал эту регулярку, но в таком случае она как раз мусор из переменной оставляет, а нормальный текст удаляется.
88536
 
попробовал эту регулярку, но в таком случае она как раз мусор из переменной оставляет, а нормальный текст удаляется.
Сейчас проверил на первом попавшемся сайте - получаю чистый текст.
Попробуйте такой штатный метод еще (тоже проверил, он полнее пропарсил текст и тоже без мусора):

88538
 
  • Оценить
Реакции: udder

Кто просматривает тему: (Всего: 0, Пользователи: 0, Гости: 0)