Не получается сравнить 2 одинаковых текста

Remedios1422

Client
Регистрация
04.02.2017
Сообщения
69
Реакции
4
Баллы
8
Паршу текст с сайта, ложу в переменную. Беру этот же текст из файла. Сравниваю одинаковый текст или нет. Пишет не одинаковый. Кодировка в обоих случаях UTF-8. Пробелов или переноса строки нет. Но если брать из файла, текст почему-то более крупного размера. С чем это может быть связано?
 

Вложения

  • 1.png
    1.png
    2,8 KB · Просмотры: 33
Добрый день
Можно пример проекта, в котором парсите и сравниваете текст?
 
Возможно, что в каком -то из текстов присутствуют переносы, пробелы в начале\конце текста.
Попробуйте перед сравнением обработать оба текста операцией Trim.
Так же можно попробовать посчитать кол-во символов в строках, чтобы понять по этому параметру они одинаковые или нет.
Еще могут быть различия в переносах. Т.е. в разных системах энтеры обозначаются по разному.
Возможно в текстах встречаются какие-то символы, которые мешают сравнению - к примеру кавычку. Попробуйте перед сравнением выполнить с обоими текстами подготовку JavaScript.
В общем-то таких моментов множество. Желательно иметь примеры, чтобы уже можно было от этого отталкиваться.
 
Возможно, что в каком -то из текстов присутствуют переносы, пробелы в начале\конце текста.
Попробуйте перед сравнением обработать оба текста операцией Trim.
Так же можно попробовать посчитать кол-во символов в строках, чтобы понять по этому параметру они одинаковые или нет.
Еще могут быть различия в переносах. Т.е. в разных системах энтеры обозначаются по разному.
Возможно в текстах встречаются какие-то символы, которые мешают сравнению - к примеру кавычку. Попробуйте перед сравнением выполнить с обоими текстами подготовку JavaScript.
В общем-то таких моментов множество. Желательно иметь примеры, чтобы уже можно было от этого отталкиваться.
всё попробовала, ничего не помогло.

Добрый день
Можно пример проекта, в котором парсите и сравниваете текст?
Я заметила, что если в кубике Записать в файл поставить галочку возле "Дописать файл", и дописывать в пустой файл в формате UTF-8, то размер будет на 3 байта больше, чем без этой галочки. Именно при такой конфигурации пишет, что текст неодинаковый. Если без галочки, или с галочкой, но файла не существует - то файл меньше на 3 байта, и пишет, что текст из файла и в переменной одинаковые
 
Я заметила, что если в кубике Записать в файл поставить галочку возле "Дописать файл", и дописывать в пустой файл в формате UTF-8, то размер будет на 3 байта больше, чем без этой галочки. Именно при такой конфигурации пишет, что текст неодинаковый. Если без галочки, или с галочкой, но файла не существует - то файл меньше на 3 байта, и пишет, что текст из файла и в переменной одинаковые

Потому что при использовании этой галочки к тексту добавляется перенос в конце строки. Соответственно эти два текста не будут уже одинаковыми.
Видимо Вы всё таки не сделали Trim или сделали его неправильно.

ZrJYR9pF9GgkDA.jpg
 
Потому что при использовании этой галочки к тексту добавляется перенос в конце строки. Соответственно эти два текста не будут уже одинаковыми.
Видимо Вы всё таки не сделали Trim или сделали его неправильно.

ZrJYR9pF9GgkDA.jpg
В кубике Записать в файл 2 галочки - "Дописать файл" и "Записать перенос строки в конец" (во всяком случае на моей версии - 5.9.9.1). Я поставила только на первом варианте галочку, так что переноса строки быть не должно.

Я думаю, проблема в том, что сигнатура UTF-8 2 раза записывается. Не подскажете как можно удалить первые 3 байта файла?
 
Да, файлы отличаются на 3 байта - EF BB BF

Как их можно удалить?
 
Да, файлы отличаются на 3 байта - EF BB BF

Как их можно удалить?
их не нужно удалять, то что пустой документ в utf-кодировке весит 3 байта, или наполненный файл в utf на 3 байта больше, чем в utf-без-bom-кодировке - это нормально..
 
Последнее редактирование:
  • Оценить
Реакции: Sergodjan
их не нужно удалять, то что пустой документ в utf-кодировке весит 3 байта, или наполненный файл в utf на 3 байта больше, чем в utf-без-bom-кодировке - это нормально..
в обоих случаях кодировка UTF-8 . Только в одном случае весит 100 Б, а в другом - 103 Б.
 
в обоих случаях кодировка UTF-8 . Только в одном случае весит 100 Б, а в другом - 103 Б.
в любом случае проблема не здесь, зеннопостер одинаково корректно работает с любым типом кодировок - с BOM или без BOM..
 
  • Оценить
Реакции: Dimionix
Добрый день
Можно пример проекта, в котором парсите и сравниваете текст?
Я заметила, что если в кубике Записать в файл поставить галочку возле "Дописать файл", и дописывать в пустой файл в формате UTF-8, то размер будет на 3 байта больше, чем без этой галочки. Именно при такой конфигурации пишет, что текст неодинаковый. Если без галочки, или с галочкой, но файла не существует - то файл меньше на 3 байта, и пишет, что текст из файла и в переменной одинаковые
Может быть Вы всё-таки пришлёте пример о котором Вас попросили ранее?
 

Вложения

  • Оценить
Реакции: art22
Может быть Вы всё-таки пришлёте пример о котором Вас попросили ранее?
Я делала немного по-другому. Текст выдёргивала из DOM до переноса строки ( <br /> ), и из файла брала первую строку.

Ваш вариант через получение значения элемента работает, спасибо.
 

Кто просматривает тему: (Всего: 0, Пользователи: 0, Гости: 0)