【发布时间】:2021-05-28 03:44:25
【问题描述】:
我正在处理客户地址的数据文件。源数据包含外来字符,采用 UTF-8 编码。
我是这样导入数据的:
columns = ['userid','email','firstname','lastname','phonenumber','fax','address','unit','city','province','postalcode','listing_geopoint','website','tier']
data = pd.read_csv(file, delimiter=',', usecols=columns, encoding='utf-8')
...执行一些操作(主要是重复数据删除)
然后这样导出数据:
clinic.to_excel('clinic-'+revision+'.xlsx',index=False)
(我也试过了)
clinic.to_csv('clinic-'+revision+'.csv',sep=seperator,index=False, encoding='utf-8')
在这两种情况下,当我打开导出文件时,我都会得到外来字符的原始 unicode 值,而不是外来字符。
例如 3031 boul de la Gare Cliniques Sp\u00e9cialis\u00e9es 3eme \u00e9tage
而不是正确的输出
3031 boul de la Gare Cliniques Spécialisées 3eme étage
我错过了什么?
【问题讨论】:
-
使用示例输入数据创建minimal reproducible example。你用什么来查看输出?