【发布时间】:2015-05-18 14:35:15
【问题描述】:
我有一些包含法语字符的 excel 文件,例如“Jean-Léon Gérôme” 当我将excel文件转换为制表符分隔的txt文件时,默认编码是ANSI,而法语字符变成了乱码,所以我需要一种可以将excel文件转换为制表符分隔文件并同时采用Unicode编码的方法。
(我知道excel可以直接导出为Unicode文本,但这不是我需要的,我需要tab delimited txt和Unicode编码的文件)
请帮忙。非常感谢!
【问题讨论】:
-
Unicode 不是一种编码,尽管 Microsoft 通常将 UTF-16 称为“Unicode”。你的意思是 UTF-8 还是 UTF-16 编码?如果文件不多,Notepad++ 等编辑器可以将 ANSI 转换为 UTF-8/16;否则,诸如 Python 之类的脚本语言可以批量转换文件。你需要哪个?
-
我尝试将 txt 文件转换为 UTF-8,但乱码仍然存在,所以我想我需要将其转换为 UTF-16 并试试运气,但我没有找到Notepad++ 或 Sublime Text Editor 中的 UTF-16 选项,如何将文件转换为 UTF-16?
-
在 Notepad++ 中,“转换为 UCS-2 Little-Endian”是 UTF-16 的子集(或命名错误)。如果您使用 UTF-8,并再次在 Excel 中打开结果,Excel 需要“使用 BOM 转换为 UTF-8”。如果您在 Notepad++ 中打开保存为 ANSI 的文件,它不应该是乱码。您可能需要准确描述保存和查看结果的方式。