Парсинг текста и кодировка страниц

  • Автор темы Автор темы romanov
  • Дата начала Дата начала

romanov

Client
Регистрация
14.05.2016
Сообщения
57
Реакции
3
Баллы
8
Необходимо парсить текст с рандомных сайтов, но возникает проблема с определением кодировки.
Этот процесс происходит по нижепредставленному алгоритму:
99phSJl.png


Но все равно в тексте встречаются кракозябры, потому-что вебмастера придумывают различные ухищрения, можно ли как-то решить эту проблему иначе?
 
Скорее всего ты шлешь заголовки Accept-Encoding с qzip или deflate сжатием, вот и кракозябры. Если это так, то меняй кодировку или расшифровывай поток
 
Скорее всего ты шлешь заголовки Accept-Encoding с qzip или deflate сжатием, вот и кракозябры. Если это так, то меняй кодировку или расшифровывай поток
Я об этом и написал, что находится иная кодировка, которая у меня не указана, и я ищу решение, которое позволяет не прописывать все возможные кодировки.
 
а не проще сылку дать ?
 
а не проще сылку дать ?
Необходимо парсить текст с рандомных сайтов

Гугл можете например открыть, у всех сайтов будет рандомная кодировка, а может произойти так, что и в заголовке не будет указана.
 
Возможно администрация знает решение?
 

Кто просматривает тему: (Всего: 0, Пользователи: 0, Гости: 0)