【发布时间】:2016-11-03 01:12:04
【问题描述】:
我有一个 csv 文件,我称之为 test.csv。它由 分隔。为了检查它的正确性,我将awk 'NR==**' test.csv | wc -w 用于不同的 ** 值,并确保它具有预期的 2595 列。
它有一个标题行。我使用以下代码将 csv 加载为 numpy 数组:
a = np.genfromtxt("test.csv", skip_header=1, delimiter=' ')
a.shape
(3367, 2595)
它正确加载了包含 2595 列的文件。
当我使用以下代码用 pandas 加载它时,它加载了列数错误的文件。
test = pd.read_csv("test.csv", sep=' ')
test.shape
(3367, 2539)
然后我使用delim_whitespace=True 而不是sep=' ',它仍然给出了相同的结果。
最后,我使用了index_col=False,它抛出了一个IndexError: list index out of range。
这是熊猫中的错误还是我做错了什么?我正在使用版本0.19.0。
【问题讨论】: