将数据集从网页读取到 Pandas 数据帧时出现 UnicodeDecodeError答案

【问题标题】：UnicodeDecodeError when reading a dataset from a webpage into a Pandas dataframe将数据集从网页读取到 Pandas 数据帧时出现 UnicodeDecodeError
【发布时间】：2018-06-05 07:44:07
【问题描述】：

我正在尝试将MovieLens dataset 复制到 Python 中的 Pandas 数据框中。

movies = pd.read_csv('http://files.grouplens.org/datasets/movielens/ml-100k/u.item', sep='|', names = ['movie_id', 'title'], usecols = range(2))
movies.head()

但是，当我执行上述操作时，出现以下错误。

UnicodeDecodeError Traceback（最近一次调用最后一次） pandas/_libs/parsers.pyx 在 pandas._libs.parsers.TextReader._convert_tokens()

pandas/_libs/parsers.pyx 中的 pandas._libs.parsers.TextReader._convert_with_dtype()

pandas/_libs/parsers.pyx in pandas._libs.parsers.TextReader._string_convert()

pandas/_libs/parsers.pyx in pandas._libs.parsers._string_box_utf8()

UnicodeDecodeError: 'utf-8' codec can't decode byte 0xe9 in position 3: invalid continuation byte

在处理上述异常的过程中，又发生了一个异常：

UnicodeDecodeError Traceback（最近一次调用最后一次）在（） 8 9 ---> 10 部电影 = pd.read_csv('http://files.grouplens.org/datasets/movielens/ml-100k/u.item', sep='|', names = ['movie_id', 'title'], usecols = range(2)) 11 电影.head()

/usr/local/lib/python3.5/dist-packages/pandas/io/parsers.py in parser_f(filepath_or_buffer, sep, delimiter, header, names, index_col, usecols, squeeze, prefix, mangle_dupe_cols, dtype,引擎，转换器，true_values，false_values，skipinitialspace，skirows，nrows，na_values，keep_default_na，na_filter，详细，skip_blank_lines，parse_dates，infer_datetime_format，keep_date_col，date_parser，dayfirst，迭代器，块大小，压缩，千位，十进制，换行符，quotechar，引用， escapechar，注释，编码，方言，tupleize_cols，error_bad_lines，warn_bad_lines，skipfooter，skip_footer，双引号，delim_whitespace，as_recarray，compact_ints，use_unsigned，low_memory，buffer_lines，memory_map，float_precision）第703章 704 --> 705 返回 _read(filepath_or_buffer, kwds) 706 707 parser_f.名称=名称

/usr/local/lib/python3.5/dist-packages/pandas/io/parsers.py in _read(filepath_or_buffer, kwds) 449 450 尝试： --> 451 数据 = parser.read(nrows) 最后452：第453章

/usr/local/lib/python3.5/dist-packages/pandas/io/parsers.py in read(self, nrows) 1063 raise ValueError（'skipfooter 不支持迭代'） 1064 -> 1065 ret = self._engine.read(nrows) 1066 第1067章

/usr/local/lib/python3.5/dist-packages/pandas/io/parsers.py in read(self, nrows) 1826 def读取（自我，nrows =无）： 1827 尝试： -> 1828 数据 = self._reader.read(nrows) 1829 除了 StopIteration： 1830 如果self._first_chunk：

pandas/_libs/parsers.pyx in pandas._libs.parsers.TextReader.read()

pandas/_libs/parsers.pyx in pandas._libs.parsers.TextReader._read_low_memory()

pandas/_libs/parsers.pyx in pandas._libs.parsers.TextReader._read_rows()

pandas/_libs/parsers.pyx in pandas._libs.parsers.TextReader._convert_column_data()

pandas/_libs/parsers.pyx in pandas._libs.parsers.TextReader._convert_tokens()

pandas/_libs/parsers.pyx 中的 pandas._libs.parsers.TextReader._convert_with_dtype()

pandas/_libs/parsers.pyx in pandas._libs.parsers.TextReader._string_convert()

pandas/_libs/parsers.pyx in pandas._libs.parsers._string_box_utf8()

UnicodeDecodeError: 'utf-8' codec can't decode byte 0xe9 in position 3: invalid continuation byte

我正在使用 Python 3 使用 Jupyter 笔记本。如何解决该错误？

【问题讨论】：

\xe9 是本机 Windows 文本编码的 é 字符编码，而不是 UTF-8。使用 movies = pd.read_csv('http://files.grouplens.org/datasets/movielens/ml-100k/u.item', sep='|', names = ['movie_id', 'title'], usecols = range(2), encoding='cp1250') 可能会起作用。

标签： python pandas parsing

【解决方案1】：

该文件不是 UTF-8 编码的。不过，我们可以做出合理的猜测，我们可以请求chardet 第三方库来帮助我们：

In [23]: import urllib, chardet

In [24]: url = 'http://files.grouplens.org/datasets/movielens/ml-100k/u.item'

In [25]: u = chardet.UniversalDetector()

In [26]: u.feed(urllib.request.urlopen(url).read())

In [27]: u.close()
Out[27]: {'confidence': 0.73, 'encoding': 'ISO-8859-1', 'language': ''}

In [28]: movies = pd.read_csv(url, sep='|', names = ['movie_id', 'title'], 
                              usecols = range(2), encoding='iso-8859-1')

In [29]: movies.head()
Out[29]: 
   movie_id              title
0         1   Toy Story (1995)
1         2   GoldenEye (1995)
2         3  Four Rooms (1995)
3         4  Get Shorty (1995)
4         5     Copycat (1995)

【讨论】：

【解决方案2】：

将文件更改为 UTF-8 格式，即可解决问题。如果您不知道如何以 UTF-8 编码格式保存文件，以下链接会有所帮助。 https://www.xadapter.com/how-to-save-csv-excel-file-as-utf-8-encoded/

【讨论】：