【发布时间】:2012-02-05 16:45:34
【问题描述】:
我正在尝试将 page_source 下载到文件中。但是,每次我得到一个:
UnicodeDecodeError: 'ascii' codec can't decode byte 0xc2 (or something else) in
position 8304: ordinal not in range(128)
我尝试过使用value.encode('utf-8'),但似乎每次它都会抛出相同的异常(除了手动尝试替换每个非ASCII字符)。有没有办法对 html 进行“预处理”以将其转换为“可写”格式?
【问题讨论】:
-
文件的实际编码是什么?
标签: python html xml unicode character-encoding