【发布时间】:2019-07-31 17:07:40
【问题描述】:
我从https://www.kaggle.com/currie32/crimes-in-chicago得到这个 csv 文件
我使用 Pandas 将 2008-20011 csv 读取到数据帧中,并收到一条 parseError 消息,指出在 csv 的某一行中,在预期的 23 个字段中找到了 41 个字段。
ParserError:标记数据时出错。 C 错误:预计第 1149094 行中有 23 个字段,看到 41
我使用此命令通过简单地跳过任何错误行来读取 csv:
CHIcrime_df2 = pd.read_csv(path, error_bad_lines=False)
按计划进行,但我想知道所有这些额外字段是什么,所以我使用 csv.reader 读取文件
with open('path') as data:
reader=csv.reader(data)
interestingrows=[row for idx, row in enumerate(reader) if idx==1149094]
我预计会有 41 个字段,但有 23 个。我还想确保我没有混淆索引,所以我在前后打印了一些;他们每个人都有相同数量的字段。谁能帮我理解这是怎么回事?
【问题讨论】:
-
您似乎在行号上打错了字。原始错误消息引用行
1149094。您查看该行的代码示例有idx==1149049。你已经交换了最后两位数字。 -
感谢@DaveCosta,我认为这只是我的问题中的错字,而不是代码。
标签: python pandas csv parse-error