【发布时间】:2011-02-28 13:27:43
【问题描述】:
我有一个 Python 脚本,它从许多来源(数据库、文件等)中提取数据。据说,所有字符串都是 unicode,但我最终得到的是以下主题的任何变化(由repr() 返回):
u'D\\xc3\\xa9cor'
u'D\xc3\xa9cor'
'D\\xc3\\xa9cor'
'D\xc3\xa9cor'
是否有可靠的方法来获取上述任意四个字符串并返回正确的 unicode 字符串?
u'D\xe9cor' # --> Décor
我现在能想到的唯一方法是使用eval()、replace(),以及永远无法洗去的深深的、燃烧的耻辱。
【问题讨论】:
-
没有古怪的编码,只有古怪的程序员。
标签: python unicode encoding character-encoding