Страницы

Поиск по вопросам

Показаны сообщения с ярлыком cp1251. Показать все сообщения
Показаны сообщения с ярлыком cp1251. Показать все сообщения

вторник, 31 марта 2020 г.

Не читает русский язык

#java #intellij_idea #utf_8 #cp1251


Работаю с файлами, мой код:

package com.company;
import java.io.*;
import  java.util.Scanner;
public class Censore {
    public static void main(String[] args) throws Exception {
        FileReader fr = new FileReader("C:\\Users\\Stepan\\Список.txt");
        Scanner scan = new Scanner(new InputStreamReader(new FileInputStream("C:\\Users\\Stepan\\Список.txt"),
"UTF-8");
        String t = scan.nextLine();
        fr.close();
        System.out.println(t);
        String[] mats = t.split(" ");
        int longarray = mats.length;
        Scanner fx = new Scanner(System.in);
        String stroka = fx.nextLine();
        for (int i = 0; i < longarray; i++) {
            stroka = stroka.replaceAll(mats[i], "*цензура*");
        }
        System.out.println(stroka);
    }
}


В файле русские символы. При их считывании Появляются значки �. Видимо тут проблема
в кодировке UTF-8. Работаю в Intellij IDEA. Подскажите, как исправить.
    


Ответы

Ответ 1



Как я уже писал выше: Стандартная виндовая кодировка - это CP-1251. В Java она кодируется как windows-1251, по этому в вашем коде нужно написать так: Scanner scan = new Scanner(new InputStreamReader(new FileInputStream("C:\\Users\\Stepan\\Список.txt"), "windows-1251")); UPD: Для справки: "ISO-8859-1" - западноевропейские языки "windows-1251" - стандартная Windows (русская) "UTF-8" - юникод

Ответ 2



Попробуйте это Scanner scanner = new Scanner( new InputStreamReader(new FileInputStream("fileNmae"), "UTF-8"));

Ответ 3



какая кодировка стоит у текстового файла? можно узнать нотпадом и т.д. и попробуйте узнать на каком кодировке выдает ИДЕА, можете проверит полученный результат вот тут: http://www.online-decoder.com/ru и ещё проверьте какая кодировка стоит на самой ИДЕА (Editor -> File Encodings)

Ответ 4



ХЗ как исправить, но винда юзает кодировку cp1251, и там руские символы шифруются иными байтами, нежели в utf-8(которая юзается средой разработки в идее так точно), т.е считанные байты нужно переводить в символы с помощью кодировки cp1251

среда, 4 марта 2020 г.

Golang xml encoding=“windows-1251”

#xml #golang #utf_8 #xmlparser #cp1251


Пишу парсер для xml файлов, но проблема в том, что в файле кодировка:
encoding="windows-1251".
Когда перевел кодировку в ut8 то следующем кодом смог распарсить документ.  

for _, file := range files {
            _, filename := utils.Unzip("/Users/farex/upload/"+file.Filename, "/Users/farex/upload/")
            _ = filename
            ///---------- Open our xmlFile-----------------------
            for _, file := range filename {
                xmlFile, err := os.Open("/Users/farex/upload/" + file)
                // if we os.Open returns an error then handle it
                if err != nil {
                    fmt.Println(err)
                }
                fmt.Println("Successfully Opened " + file)

                if utils.Cut(file, 1) == "H" {

                    defer xmlFile.Close()

                    byteValue, _ := ioutil.ReadAll(xmlFile)
                    var zl_list models.ZL_LIST

                    xml.Unmarshal(byteValue, &zl_list)

                    fmt.Println("---ZGLV---")
                    fmt.Println("VERSION" + zl_list.ZGLV[0].VERSION)
                    fmt.Println("DATA" + zl_list.ZGLV[0].DATA)
                    fmt.Println("FILENAME" + zl_list.ZGLV[0].FILENAME)
                    fmt.Println("SD_z" + zl_list.ZGLV[0].SD_Z)


Это все работает, но задача парсить не Документы в формате utf8 , а в cp-1251.
Как можно "конвертировать" cp-1251 в utf-8 ?
Добавил меторд:

func EncodeWindows1251(ba []uint8) []uint8 {
    enc := charmap.Windows1251.NewEncoder()
    out, _ := enc.String(string(ba))
    return []uint8(out)
}


и соответственно вызываю его:

byteValue, _ := ioutil.ReadAll(xmlFile)
a := EncodeWindows1251(byteValue)
var zl_list  models.ZL_LIST
xml.Unmarshal(a, &zl_list)


Тоже не работает...
Но если из документа убрать строку .
То все работает и документ парсится... Неужели придется регуляркой удалять эту строчку
в документе?

Добавил метод наисанный ниже и за импортировал.        "golang.org/x/text/encoding/charmap".
Но:


Образец файла xml тут кодировка cp-1251
    


Ответы

Ответ 1



Для этого существует поле Decoder.CharsetReader: // CharsetReader, if non-nil, defines a function to generate // charset-conversion readers, converting from the provided // non-UTF-8 charset into UTF-8. If CharsetReader is nil or // returns an error, parsing stops with an error. One of the // the CharsetReader's result values must be non-nil. CharsetReader func(charset string, input io.Reader) (io.Reader, error) Использовать можно так: d := xml.NewDecoder(xmlFile) d.CharsetReader = func(charset string, input io.Reader) (io.Reader, error) { switch charset { case "windows-1251": return charmap.Windows1251.NewDecoder().Reader(input), nil default: return nil, fmt.Errorf("unknown charset: %s", charset) } } err := d.Decode(&zlList)

четверг, 9 января 2020 г.

Переконвертация UTF8 <> 1251 и большая буква “И”

#java #utf_8 #encoding #cp1251


Берем строку "Игра!" и переводим в массив байт (1).
Создаём строку, из этого массива байт, но указываем "неверную" кодировку(2).
В итоге получаем строку с "поехавшей кодировкой"(utf8AsW1251 ).

Выполняем обратные действия(3). 
и видим что строка переконвертировалась нормально за исключение большой буквы "И".
Почему большая буква "И" отображается как �? ?

import java.nio.charset.Charset;

public class Main {
private static final Charset CS_1251 = Charset.forName("windows-1251");
private static final Charset CS_UTF8 = Charset.forName("UTF-8");

public static void main(String[] args) {
    String in = "Игра!";
    byte[] bytesUtf8 = in.getBytes(CS_UTF8);                    //(1)
    String utf8AsW1251 = new String(bytesUtf8, CS_1251);        //(2) 

    System.out.println("utf8 bytes as 1251: " + utf8AsW1251);   //utf8 bytes as 1251:
�гра!

    System.out.println(
            new String(utf8AsW1251.getBytes(CS_1251), CS_UTF8)  //(3) 
    );                                                          //�?гра!
}


}
    


Ответы

Ответ 1



– Доктор, когда я делаю так, у меня болит – Не делайте так Буква И кодируется в utf-8 как последовательность байтов 0xd0, 0x98 Код 0xd0 соответствует символу Р в кодировке cp1251, а вот код 0x98 не соответствует никакому символу, он просто отсутствует в кодировке, поэтому вместо несуществующего символа будет подставлен заменяющий. Получится строка Р�. Cимвол � тоже отсутсвует в cp1251, поэтому при повторном кодировании будет заменен на ? (с кодом 0x3f), получаем последовательность байтов 0xd0, 0x3f. При декодировании сталкиваемся еще с одной проблемой: последовательность 0xd0, 0x3f недопустима в utf-8, поэтому теперь уже вместо 0xd0 будет подставлен заменяющий символ, в итоге получается строка �? С остальными буквами такого может и не произойти, но это не значит, что подобные манипуляции всегда будут приводить к правильному результату Й → 0xd0, 0x99 → Р™ → 0xd0, 0x99 → Й

воскресенье, 29 декабря 2019 г.

Как отправить POST запрос в jQuery Ajax в CP1251?

#jquery #ajax #javascript #cp1251 #post


Есть форум IPB 2.3.6 с кодировкой cp1251. Надо запостить сообщение в тему.
Вот код:
(function NewPost(fid, tid, auth_key) {
    var ajaxUrl = 'http://example.com/index.php?';    
    var text = "Тестовый пост";    
    var baseData = { act: "Post", CODE: "03", f: fid, t: tid, auth_key: auth_key,
Post: text};    
    var jqxhr = jQuery.ajax({             
        type: "POST",    
        data: baseData,    
        dataType: "html",    
        contentType: 'application/x-www-form-urlencoded; charset=windows-1251',
        url: ajaxUrl    
        })
        jqxhr.done( function(data) {    
        console.log('Новое сообщение создано')   
      })
    jqxhr.fail( function(err) {
        console.log(err)
      })
}) (227, 11764579, '17cc48183ae68447d8836f40932ba4e4')

В результате на сайте выводится текст на UTF -> каракули.
Как решить проблему без изменений на сервере - форум не мой.    


Ответы

Ответ 1



Никак. AJAX-запросы передаются только в UTF-8

Ответ 2



Я так решил, когда у меня проблема подобная возникла: function sendForm(url, data, ok, error, callback) { var str = ""; var boundary = '----WebKitFormBoundary5zih7EsEnWJI1WJw'; for(var i in data) { str += '--' + boundary + '\r\n' + 'Content-Disposition: form-data; name="'+i+'"\r\n\r\n' + data[i] + '\r\n'; } var converted_str = UnicodeToWin1251(str); var send_arr = new Uint8Array(converted_str.length); for(var i = 0; i < converted_str.length; ++i) send_arr[i] = converted_str.charCodeAt(i); var xhttp = new XMLHttpRequest(); xhttp.onreadystatechange = function() { if (this.readyState == 4) { if(this.status == 200) { ok(this.responseText); } else { error(this.responseText); } callback(); } }; xhttp.open("POST", url, true); xhttp.setRequestHeader('Content-Type', 'multipart/form-data; boundary='+boundary); xhttp.send(send_arr); } var DMap = {0: 0, 1: 1, 2: 2, 3: 3, 4: 4, 5: 5, 6: 6, 7: 7, 8: 8, 9: 9, 10: 10, 11: 11, 12: 12, 13: 13, 14: 14, 15: 15, 16: 16, 17: 17, 18: 18, 19: 19, 20: 20, 21: 21, 22: 22, 23: 23, 24: 24, 25: 25, 26: 26, 27: 27, 28: 28, 29: 29, 30: 30, 31: 31, 32: 32, 33: 33, 34: 34, 35: 35, 36: 36, 37: 37, 38: 38, 39: 39, 40: 40, 41: 41, 42: 42, 43: 43, 44: 44, 45: 45, 46: 46, 47: 47, 48: 48, 49: 49, 50: 50, 51: 51, 52: 52, 53: 53, 54: 54, 55: 55, 56: 56, 57: 57, 58: 58, 59: 59, 60: 60, 61: 61, 62: 62, 63: 63, 64: 64, 65: 65, 66: 66, 67: 67, 68: 68, 69: 69, 70: 70, 71: 71, 72: 72, 73: 73, 74: 74, 75: 75, 76: 76, 77: 77, 78: 78, 79: 79, 80: 80, 81: 81, 82: 82, 83: 83, 84: 84, 85: 85, 86: 86, 87: 87, 88: 88, 89: 89, 90: 90, 91: 91, 92: 92, 93: 93, 94: 94, 95: 95, 96: 96, 97: 97, 98: 98, 99: 99, 100: 100, 101: 101, 102: 102, 103: 103, 104: 104, 105: 105, 106: 106, 107: 107, 108: 108, 109: 109, 110: 110, 111: 111, 112: 112, 113: 113, 114: 114, 115: 115, 116: 116, 117: 117, 118: 118, 119: 119, 120: 120, 121: 121, 122: 122, 123: 123, 124: 124, 125: 125, 126: 126, 127: 127, 1027: 129, 8225: 135, 1046: 198, 8222: 132, 1047: 199, 1168: 165, 1048: 200, 1113: 154, 1049: 201, 1045: 197, 1050: 202, 1028: 170, 160: 160, 1040: 192, 1051: 203, 164: 164, 166: 166, 167: 167, 169: 169, 171: 171, 172: 172, 173: 173, 174: 174, 1053: 205, 176: 176, 177: 177, 1114: 156, 181: 181, 182: 182, 183: 183, 8221: 148, 187: 187, 1029: 189, 1056: 208, 1057: 209, 1058: 210, 8364: 136, 1112: 188, 1115: 158, 1059: 211, 1060: 212, 1030: 178, 1061: 213, 1062: 214, 1063: 215, 1116: 157, 1064: 216, 1065: 217, 1031: 175, 1066: 218, 1067: 219, 1068: 220, 1069: 221, 1070: 222, 1032: 163, 8226: 149, 1071: 223, 1072: 224, 8482: 153, 1073: 225, 8240: 137, 1118: 162, 1074: 226, 1110: 179, 8230: 133, 1075: 227, 1033: 138, 1076: 228, 1077: 229, 8211: 150, 1078: 230, 1119: 159, 1079: 231, 1042: 194, 1080: 232, 1034: 140, 1025: 168, 1081: 233, 1082: 234, 8212: 151, 1083: 235, 1169: 180, 1084: 236, 1052: 204, 1085: 237, 1035: 142, 1086: 238, 1087: 239, 1088: 240, 1089: 241, 1090: 242, 1036: 141, 1041: 193, 1091: 243, 1092: 244, 8224: 134, 1093: 245, 8470: 185, 1094: 246, 1054: 206, 1095: 247, 1096: 248, 8249: 139, 1097: 249, 1098: 250, 1044: 196, 1099: 251, 1111: 191, 1055: 207, 1100: 252, 1038: 161, 8220: 147, 1101: 253, 8250: 155, 1102: 254, 8216: 145, 1103: 255, 1043: 195, 1105: 184, 1039: 143, 1026: 128, 1106: 144, 8218: 130, 1107: 131, 8217: 146, 1108: 186, 1109: 190} function UnicodeToWin1251(s) { var L = [] for (var i=0; i

Ответ 3



Ну, вообще-то передать через AJAX cp1251 можно. Просто он не будет об этом знать. Если настроить принимающую сторону на прием cp1251 - все нормально будет. Способ я подробно описал где-то там: http://qweewqrty.blogspot.ru/2013/10/win1251-ajax.html Естественно, там нет глупых перекодировок в utf и обратно. И да, принимать по аяксу можно что угодно, не только utf. Просто укажите правильный Content-type.

Ответ 4



Может использовать xml для передачи данных?

среда, 12 июня 2019 г.

Golang xml encoding=“windows-1251”

Пишу парсер для xml файлов, но проблема в том, что в файле кодировка: encoding="windows-1251". Когда перевел кодировку в ut8 то следующем кодом смог распарсить документ.
for _, file := range files { _, filename := utils.Unzip("/Users/farex/upload/"+file.Filename, "/Users/farex/upload/") _ = filename ///---------- Open our xmlFile----------------------- for _, file := range filename { xmlFile, err := os.Open("/Users/farex/upload/" + file) // if we os.Open returns an error then handle it if err != nil { fmt.Println(err) } fmt.Println("Successfully Opened " + file)
if utils.Cut(file, 1) == "H" {
defer xmlFile.Close()
byteValue, _ := ioutil.ReadAll(xmlFile) var zl_list models.ZL_LIST
xml.Unmarshal(byteValue, &zl_list)
fmt.Println("---ZGLV---") fmt.Println("VERSION" + zl_list.ZGLV[0].VERSION) fmt.Println("DATA" + zl_list.ZGLV[0].DATA) fmt.Println("FILENAME" + zl_list.ZGLV[0].FILENAME) fmt.Println("SD_z" + zl_list.ZGLV[0].SD_Z)
Это все работает, но задача парсить не Документы в формате utf8 , а в cp-1251. Как можно "конвертировать" cp-1251 в utf-8 ? Добавил меторд:
func EncodeWindows1251(ba []uint8) []uint8 { enc := charmap.Windows1251.NewEncoder() out, _ := enc.String(string(ba)) return []uint8(out) }
и соответственно вызываю его:
byteValue, _ := ioutil.ReadAll(xmlFile) a := EncodeWindows1251(byteValue) var zl_list models.ZL_LIST xml.Unmarshal(a, &zl_list)
Тоже не работает... Но если из документа убрать строку То все работает и документ парсится... Неужели придется регуляркой удалять эту строчку в документе?
Добавил метод наисанный ниже и за импортировал. "golang.org/x/text/encoding/charmap". Но:
Образец файла xml тут кодировка cp-1251


Ответ

Для этого существует поле Decoder.CharsetReader
// CharsetReader, if non-nil, defines a function to generate // charset-conversion readers, converting from the provided // non-UTF-8 charset into UTF-8. If CharsetReader is nil or // returns an error, parsing stops with an error. One of the // the CharsetReader's result values must be non-nil. CharsetReader func(charset string, input io.Reader) (io.Reader, error)
Использовать можно так:
d := xml.NewDecoder(xmlFile) d.CharsetReader = func(charset string, input io.Reader) (io.Reader, error) { switch charset { case "windows-1251": return charmap.Windows1251.NewDecoder().Reader(input), nil default: return nil, fmt.Errorf("unknown charset: %s", charset) } } err := d.Decode(&zlList)

среда, 12 декабря 2018 г.

Как отправить POST запрос в jQuery Ajax в CP1251?

Есть форум IPB 2.3.6 с кодировкой cp1251. Надо запостить сообщение в тему. Вот код: (function NewPost(fid, tid, auth_key) { var ajaxUrl = 'http://example.com/index.php?'; var text = "Тестовый пост"; var baseData = { act: "Post", CODE: "03", f: fid, t: tid, auth_key: auth_key, Post: text}; var jqxhr = jQuery.ajax({ type: "POST", data: baseData, dataType: "html", contentType: 'application/x-www-form-urlencoded; charset=windows-1251', url: ajaxUrl }) jqxhr.done( function(data) { console.log('Новое сообщение создано') }) jqxhr.fail( function(err) { console.log(err) }) }) (227, 11764579, '17cc48183ae68447d8836f40932ba4e4') В результате на сайте выводится текст на UTF -> каракули. Как решить проблему без изменений на сервере - форум не мой.


Ответ

Никак. AJAX-запросы передаются только в UTF-8