【发布时间】:2014-11-22 04:57:27
【问题描述】:
我有一个项目正在进行中,可以根据一组任意规则读取和转换 CSV 文件,选择一个文件告诉程序它应该如何根据输入输出数据并解析文件。
我遇到的问题是,当我从输入文件中读取行时,它有时会读取额外的行或将行中途分成两行,我最初使用 ReadAllLines 然后使用以下代码进行测试:
int testCount = 0;
StreamReader sr = File.OpenText(_FilePath.Text);
while(!sr.EndOfStream)
{
sr.ReadLine();
testCount++;
}
sr.Close();
sr.Dispose();
Console.WriteLine("Lines in For: " + testCount);
发现有 627 行的文件被读取为有 681 行(同时使用 ReadAllLines 并计算上述代码中的行数。
我尝试寻找有同样问题的人,并尝试查看这些方法中是否存在“行”的最大长度,谷歌上没有出现任何内容,文件中起作用的第一行是这个一个(为保护隐私更改了行中的信息,所有特殊字符都存在)
CODE, A/B Company Name, CONTACT NAME, ATTN NAME A/B, 1234 CORPORATE CORP ST, Smithington, SM, 1234, , 123-456-7890, 123-456-7890, 12345 Plum ROAD, , Nowhere, NW, 12345, A/B Company Name2, Courier, , "Some A Info B For.Shipping Accnt. # 123456789 calendar days early^ 3 days late.", ,
文件本身已从 Excel 电子表格导出为 CSV,原始文件中的所有逗号都替换为 ^(以防止出现问题),稍后将重新转换为逗号。
那么,任何人都知道 ReadAllLines 中行的长度有限制,还是在幕后发生了其他事情?因为这是从 Excel 导出的(最初是一个 DBF 文件)我不“认为”这是文件的问题,但我可能是错的,我能做些什么来找出答案?
【问题讨论】:
-
您观察到的这些文件很可能使用不同于 UTF8 的编码。看看这个:stackoverflow.com/questions/10903120/…
-
PS:您可以在 Notepad++ 中查看编码,和/或选择在此处以不同的编码查看该文件,它应该会显示此行号更改。
-
@Alexandru:UTF8 使用与 ASCII、Windows-1252、ISO-8859 等相同的换行符。唯一完全不同的常见编码是 UTF16,如果文件正在错误地读取为 UTF16,或者当它应该是 UTF16 时读取为其他东西,它的错误不仅仅是额外的换行符。
-
如果您想真的查看文件中的内容,请使用 XVI32 十六进制编辑器:chmaas.handshake.de/delphi/freeware/xvi32/xvi32.htm
-
@PeterDuniho 啊,有趣。