【发布时间】:2017-11-09 15:31:10
【问题描述】:
我想知道如何从非 ASCII 编码中读取字母,而不会“损坏”它们。
这里是娱乐:
print(open("somefile.txt").read())
somefile.txt(保存为 unicode)
čđža
我得到的是这样的:
ÿþ
~a
如何获取文件的原始内容?
【问题讨论】:
-
'saved as unicode' 并不能真正告诉您如何正确读取文件,您需要知道编码。
-
@pvg 我对编码不太擅长,如何检查它是哪种编码?
-
你是如何创建这个文件的?您的典型文本编辑器将向您显示编码。然后,您可以将其作为命名参数传递给
open,它在文档中。 -
我只是喜欢在记事本中创建它,保存时它说我不应该选择ANSI,所以我将它设置为unicode。我没有看到其他任何东西。
-
下载 sublime 或 notepad++ 之类的,notepad 使用奇怪的术语。任何认真的编辑都会在状态行显示编码。
标签: python python-3.x