【问题标题】:How can retrieve / decode html utf-8 character with unicode?如何使用 unicode 检索/解码 html utf-8 字符?
【发布时间】:2019-09-06 15:45:50
【问题描述】:
当我尝试访问任何与 unicode हिंदी 文本集成的网站时,浏览器会显示包含类似...
¤ªà¤•à¥�षी के पास वोसारी सà¥�ठ– सà¥�विधाà¤�à¤�हà¥^ं, जो उनके ठ——à
如何解码这个字符并转换成纯unicode?p>
【问题讨论】:
-
� 表示使用错误的字符编码将字节解码为文本。从那时起,原始文本无法恢复。您必须使用作者使用的字符编码以外的字符编码向上游读取任何内容。我希望这有帮助。你的问题不清楚。请edit.
标签:
html
unicode
utf-8
decode
font-face
【解决方案1】:
这是 UTF-8 编码的梵文,错误地显示为 Windows-1252。如果你反转方向,例如
piconv -f utf-8 -t windows-1252 -s '¤ªà¤•à¥�षी के पास वोसारी सà¥�ख सà¥�विधाà¤�à¤� हैं, जो उनके जà'
然后你得到原始文本的一部分:
��क��?षी के पास वोसारी स��?ख स��?विधा��?��? हैं, जो उनके ज�
您的复制粘贴操作使此处的解码有损。将输入重定向到文件而不是复制粘贴,以免引入任何缺陷。
piconv 随 Perl 一起提供。