【问题标题】:Encoding problem: Convert bytes to Chinese characters in R编码问题:在R中将字节转换为汉字
【发布时间】:2020-03-25 06:54:27
【问题描述】:

我从 R 中的一个包含中文字符的 html 文件中读取。但它显示类似

"    <td class=\"forumCell\"><a href=\"#\" onClick=\"if(confirm('\xc4\xe3\u0237\xd0\xc5Ҫ\xbbָ\xb4\xb8\xc3\xce\xc4\xd5\xc2\xc2\xf0\xa3\xbf')){location.href='articleBakAdmin.php?action=restore&articleID=120516';}\">\xbbָ\xb4</a></td>"

这是我需要提取的“\x”字符串。如何将它们转换成可读的汉字?

顺便说一句,以某种方式简单地复制和粘贴上面的 \x 字符串不会复制问题。

【问题讨论】:

    标签: r unicode encoding utf-8


    【解决方案1】:

    你确定它们都是汉字吗?什么是html页面编码?您粘贴的字符串看起来是十六进制 \xc4\xe3 和 unicode 字符 \u0237 的混合体。

    【讨论】:

    • 没错... R 告诉我我混合了十六进制和 Unicode。但是当我检查“isUTF8”时,它返回是。
    • 如何查看网站的编码?
    • 如果你使用chrome浏览器,你可以通过F12打开DevTools,然后加载网站并在控制台输入document.charset。这应该为您提供当前文档的编码。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2020-07-25
    • 2015-03-15
    • 1970-01-01
    • 2023-04-02
    • 2013-02-13
    相关资源
    最近更新 更多