Парсер e-mail'ов

  • Автор темы Автор темы Temashka
  • Дата начала Дата начала

Temashka

Новичок
Регистрация
13.02.2015
Сообщения
1
Реакции
0
Баллы
1
Ребята, не нашел на форуме информацию о парсере мыла с определенного сайта, подскажите, как создать такой проект, при котором будут собираться все мейлы с определенного сайта или определенных страниц?

Допустим меня интересует сбор почты всех отелей в Турции с сайта Tophotels.ru
Как это сделать?
 
Долго объяснять нужно, легче у кого то заказать шаблон для этого. Много нюансов может быть, а так как вы в этом Новичок, тогда и времени на обучение потребуется потратить прилично.
 
Вопрос нужно конкретизировать. Что сделали, на чем застряли, что не получилось.
Вряд ли вам кто-то сейчас распишет пошагово все ваши действия.
Начните с того что полностью почитайте wiki, проанализируйте структуру тестовых шаблонов в projectmaker.
Там есть пример парсинга для бинга. Чтобы собрать все ссылки. После аналогичной реализации для нужного вам сайта нужно будет написать шаблон, который будет брать URL из списка и ходить по каждой странице. А оттуда уже экшеном Операции с текстом - Regex уже можно парсить данные. Или каким то иным образом, если мыло всегда лежит в определенном месте страницы.
В любом случае перед выполнением задачи изучите функционал программы
 
Парсинг e-mail адресов, ссылок и т.п. производится с помощью регулярных выражений - https://wiki.zennolab.com/doku.php?id=ru:creating-a-regular-expressions
Вам нужно просто подходящую регулярку для вашего сайта подобрать. E-mail адреса можно выдирать примерно таким выражением - \b[a-zA-Z0-9._%+-]+@[a-z0-9.-]+\.[a-z]{2,4}\b
 
  • Оценить
Реакции: Kirya и erema
уже давно удалил(.
 
Парсинг e-mail адресов, ссылок и т.п. производится с помощью регулярных выражений - https://wiki.zennolab.com/doku.php?id=ru:creating-a-regular-expressions
Вам нужно просто подходящую регулярку для вашего сайта подобрать. E-mail адреса можно выдирать примерно таким выражением - \b[a-zA-Z0-9._%+-]+@[a-z0-9.-]+\.[a-z]{2,4}\b
молоток,спасибо!
 
а как задать глубину поиска?
 
Интересная тема, но даже не знаю с чего начать делать такой шаб, как узнать вообще можно ли с определенного сайта вытащить мыло?
пройтись регуляркой по DOM =)
ну а так, на вскидку искать на сайте ссылку контакты, о нас - переходить на страницу, парсить дом модель и сохранять результат в файлик
 
пройтись регуляркой по DOM =)
ну а так, на вскидку искать на сайте ссылку контакты, о нас - переходить на страницу, парсить дом модель и сохранять результат в файлик
так, я так и сделал, а он только 60 результатов выдает
 
Парсинг e-mail адресов, ссылок и т.п. производится с помощью регулярных выражений - https://wiki.zennolab.com/doku.php?id=ru:creating-a-regular-expressions
Вам нужно просто подходящую регулярку для вашего сайта подобрать. E-mail адреса можно выдирать примерно таким выражением - \b[a-zA-Z0-9._%+-]+@[a-z0-9.-]+\.[a-z]{2,4}\b
Огромное спасибо тебе, админушка, регулярка ваще найс, просто ахонь!
 
Парсинг e-mail адресов, ссылок и т.п. производится с помощью регулярных выражений - https://wiki.zennolab.com/doku.php?id=ru:creating-a-regular-expressions
Вам нужно просто подходящую регулярку для вашего сайта подобрать. E-mail адреса можно выдирать примерно таким выражением - \b[a-zA-Z0-9._%+-]+@[a-z0-9.-]+\.[a-z]{2,4}\b


Подниму темку)

Подскажите пожалуйста, как немного доработать эту регулярку.
На странице есть список адресов вида example@mail\.com и вот такие со звездочкой example1@mail\.com\n \* .
Беру DOM, из него начинаю выбирать мыла регуляркой
\b[a-zA-Z0-9._%+-]+@[a-z0-9.-]+\.[a-z]{2,4}\b
при этом мыла парсятся в виде example@mail.com, example1@mail.com и тд. Как изменить регулярку, чтобы она на выходе отдавала почты с этой звездочкой \n \*, если она есть у мыла?
 

Вложения

  • DOM.txt
    DOM.txt
    149,8 KB · Просмотры: 211
Последнее редактирование:

Кто просматривает тему: (Всего: 0, Пользователи: 0, Гости: 0)