【发布时间】:2018-12-19 17:50:22
【问题描述】:
设置
任务是用 Pandas 读取这个 csv(即pd.read_csv(filename)):
title,description
Jeans,"blue"
Jeans,"2\" seam"
Jeans,"2\" seam, blue"
代码来试试这个
import os
import pandas as pd
with open("/tmp/test.csv", "w") as f:
f.write('''title,description
Jeans,"blue"
Jeans,"2\" seam"
Jeans,"2\" seam, blue"
''')
pd.read_csv("/tmp/test.csv")
问题
预期输出:
title description
0 Jeans blue
1 Jeans 2" seam
2 Jeans 2" seam, blue
但实际上它可以:
- 读第一行没问题
- 读错第二行但不报错
- 第三行读取失败,出现错误
读取到第二行的结果:
title description
0 Jeans blue
1 Jeans 2 seam"
读取到第三行时出错:
ParserError:标记数据时出错。 C 错误:预期有 4 个字段在行 3、锯5
这似乎是一个常见问题。 Pandas read_csv 中是否有可以处理这个问题的配置?
【问题讨论】:
-
你认为答案是什么?
-
向问题添加了预期输出