【发布时间】:2015-12-23 11:12:20
【问题描述】:
我有一个带有西班牙语文本的 UTF-8 文件,在软件的一些中,一些带有重音符号的单词显示不正确。
我相信我的文件是正确的。例如,名称“JESÚS”编码为4A 45 53 C3 9A 53。
>>> b'\x4A\x45\x53\xC3\x9A\x53'.decode('utf-8')
'JESÚS'
c39a 是 \u00da 的正确 UTF-8 编码,根据 http://www.fileformat.info/info/unicode/char/00da/index.htm。
那么,为什么有些软件渲染不正确呢?
【问题讨论】:
-
因为解码不正确,见en.wikipedia.org/wiki/Mojibake
-
“为什么有些软件渲染不正确?” 太宽泛了。是 Python 3 软件吗?是Windows系统上的文本文件吗?
标签: python unicode utf-8 mojibake