【发布时间】:2021-06-01 06:22:22
【问题描述】:
Pandas read_csv shape[0] 或 len(index) 函数返回我计算机上的 2000 万行文件的 19929388 行。但是下面的powershell命令返回2000万。我的代码有问题吗?
Powershell - 返回 20000000
[int]$LinesInFile = 0
$reader = New-Object IO.StreamReader 'File.csv'
while($reader.ReadLine() -ne $null){ $LinesInFile++ }
Python - 返回 19929388
df = pd.read_csv(path, low_memory=(False), delimiter='|', header=None)
index = df.shape[0]
print(index)
【问题讨论】:
-
默认情况下,
skip_blank_lines参数为True,对应于 read_csv。这将“跳过空白行而不是解释为 NaN 值。” -
嗨@HenryEcker,我的文件的第一列总是被填充。无论如何,我已经尝试过
skip_blank_lines=False并得到了相同的结果 (19929388)。 -
使用
engine='python'我遇到了一些错误,例如 Skipping line 182405: '|'预计在 '"' 之后。我认为这没有意义,因为我没有在 read_csv 上将引用作为参数传递