【发布时间】:2015-01-15 14:13:48
【问题描述】:
我有一个 500MB+ 的文件,它是通过将大型 Excel 电子表格另存为 unicode 生成的。 我正在运行 Windows 7。
我需要用 python pandas 打开文件。到目前为止,我曾经使用 notepad++ 将文件从 ANSI 转换为 UTF-8,但现在文件太大了,然后使用 notepad++ 打开它。
我有希伯来语、法语、瑞典语、挪威语、丹麦语特殊字符。
- Panda 的
read_excel太慢了 * 我放了几分钟,没有看到任何输出。 -
iconv:显然我无法正确编码,当我有tried 时,我只是得到一个制表符分隔的空值列表:iconv -f "CP858" -t "UTF-8" file1.txt > file2.txt
iconv -f "windows-1252" -t "UTF-8" file1.txt > file2.txt
编辑
iconv -f "UTF-16le" -t "UTF-8" file1.txt > file2.txt 导致一个非常奇怪的行为:行之间的行被剪切。一切看起来都很好,但实际上只转换了 80K 行。
编辑 2
.. read_csv 和 encoding='utf-16le' 可以正确读取文件。但是,我仍然不明白为什么iconv 搞砸了。
【问题讨论】:
标签: windows excel encoding utf-8 pandas