【发布时间】:2015-12-25 01:37:54
【问题描述】:
我正在尝试使用一些 python 模块,但它给了我以下错误:
UnicodeDecodeError: 'utf8' codec can't decode byte 0xa9 in position 1
我认为是因为我的输入文件中包含非 UTF-8 字符,所以我想在将文件传递给模块之前对其进行清理。
如果我想识别非 UTF-8 字符并删除它们,我该怎么做?我试着用谷歌搜索它,但找不到好的答案。
【问题讨论】:
-
信息不足。你的输入数据是什么?它应该有一个可识别的编码。您无需猜测。
-
我使用名为 Apache Tika 的开源软件从一堆 PDF 和 PPT 文章中提取了文本。
-
我猜它是 Windows 代码页之一,例如 windows-1252。
0xa9将是版权标志。 -
@roeland 是的,没错。这是一个版权标志!