【发布时间】:2020-06-13 19:55:56
【问题描述】:
我使用 tweepy 使用 Python csv.writer() 将推文的文本存储在 csv 文件中,但我必须在存储之前将文本编码为 utf-8,否则 tweepy 会引发奇怪的错误。
将熊猫导入为 pd
data = pd.read_csv('C:\Users\Lenovo\Desktop\_Carabinieri_10_tweets.csv', delimiter=",", encoding="utf-8")
data.head()
打印(data.head())
现在,文本数据是这样存储的:
输出
id … 文本
0 1228280254256623616 … b'RT @MinisteroDifesa:#14febbraio Il Ministro…
1 1228257366841405441 … b'\xe2\x80\x9cNon t\xe2\x80\x99ama chi amor ti…
2 1228235394954620928 … b'Eseguite dai #Carabinieri del Nucleo Investi…
3 1228219588589965316 ... b'Il pianeta brucia\nConosci il black carbon?...
4 1228020579485261824 ... b'RT @Coninews: Emozioni tricolore \xe2\x9c\xa...
虽然我使用“utf-8”将文件读入 DataFrame,代码如下所示,但输出中的字符看起来非常不同。输出看起来像字节。语言是意大利语。
我尝试使用此代码对此进行解码(其他列中有更多数据,文本在第二列中)。但是,它不会解码文本。我不能使用 .decode('utf-8') 因为 csv 阅读器将数据读取为字符串,即 type(row[2]) 是 'str' 并且我似乎无法将其转换为字节,数据再次被编码!
如何解码文本数据?
如果您能对此提供帮助,我将非常高兴,在此先感谢您。
【问题讨论】: