【发布时间】:2010-09-21 00:18:51
【问题描述】:
例如,如果我有一个 unicode 字符串,我可以将其编码为 ASCII 字符串,如下所示:
>>> u'\u003cfoo/\u003e'.encode('ascii')
'<foo/>'
但是,我有例如这个 ASCII 字符串:
'\u003foo\u003e'
... 我想变成与上面第一个示例相同的 ASCII 字符串:
'<foo/>'
【问题讨论】:
例如,如果我有一个 unicode 字符串,我可以将其编码为 ASCII 字符串,如下所示:
>>> u'\u003cfoo/\u003e'.encode('ascii')
'<foo/>'
但是,我有例如这个 ASCII 字符串:
'\u003foo\u003e'
... 我想变成与上面第一个示例相同的 ASCII 字符串:
'<foo/>'
【问题讨论】:
根据字符串的来源,这有点危险,但是怎么样:
>>> s = '\u003cfoo\u003e'
>>> eval('u"'+s.replace('"', r'\"')+'"').encode('ascii')
'<foo>'
【讨论】:
我花了一段时间才弄清楚这个问题,但this page 给出了最佳答案:
>>> s = '\u003cfoo/\u003e'
>>> s.decode( 'unicode-escape' )
u'<foo/>'
>>> s.decode( 'unicode-escape' ).encode( 'ascii' )
'<foo/>'
还有一个“raw-unicode-escape”编解码器来处理指定 Unicode 字符串的另一种方式——查看链接页面的“Unicode 构造函数”部分了解更多详细信息(因为我不是那种 Unicode-saavy) .
【讨论】:
在 Python 2.5 上,正确的编码是“unicode_escape”,而不是“unicode-escape”(注意下划线)。
我不确定较新版本的 Python 是否更改了 unicode 名称,但这里只使用下划线。
不管怎样,就是这样。
【讨论】:
Ned Batchelder 说:
根据字符串的来源,这有点危险, 但是怎么样:
>>> s = '\u003cfoo\u003e' >>> eval('u"'+s.replace('"', r'\"')+'"').encode('ascii') '<foo>'
实际上这种方法可以像这样变得安全:
>>> s = '\u003cfoo\u003e'
>>> s_unescaped = eval('u"""'+s.replace('"', r'\"')+'-"""')[:-1]
注意三引号字符串和结束三引号之前的破折号。
因此无需担心用户输入的内容,只要以原始格式捕获即可。
【讨论】:
当您在要解码的字符串中遇到特殊字符(如汉字或表情符号)时,有时您会遇到问题,即如下所示的错误:
UnicodeEncodeError: 'ascii' codec can't encode characters in position 109-123: ordinal not in range(128)
对于我的情况(推特数据处理),我解码如下,让我可以看到所有没有错误的字符
>>> s = '\u003cfoo\u003e'
>>> s.decode( 'unicode-escape' ).encode( 'utf-8' )
>>> <foo>
【讨论】: