【发布时间】:2013-05-06 13:01:56
【问题描述】:
我有一个未编码的文本,我想用 latin-1 编码。某些字符无法编码。如果我使用带有“replace”参数的编码,我会得到问题标签字符,但是,有没有办法调用自定义函数来替换字符?
例如,我想将所有可能的字符转换为 latin-1,并对不可编码的字符调用 unidecode.unidecode()。这可能吗?
【问题讨论】:
我有一个未编码的文本,我想用 latin-1 编码。某些字符无法编码。如果我使用带有“replace”参数的编码,我会得到问题标签字符,但是,有没有办法调用自定义函数来替换字符?
例如,我想将所有可能的字符转换为 latin-1,并对不可编码的字符调用 unidecode.unidecode()。这可能吗?
【问题讨论】:
您可以使用codecs.register_error('myerrorhandler', function) 创建自己的错误处理程序。
>>> import codecs
>>> codecs.register_error('silly', lambda e: ('X', e.start+1))
>>> 'foöbar'.encode('ascii', 'silly')
b'foXbar'
>>>
【讨论】:
UnicodeDecodeError: 'ascii' codec can't decode byte 0xc3 in position 2: ordinal not in range(128)
u'foöbar' 和 u'X' 才能使此代码正常工作。