【发布时间】:2021-02-24 11:47:56
【问题描述】:
我的 CSV 数据如下所示:
ID;name;info
1;ABC;text1
2;DEF;text2;text3
3;GHI;text4;
4;JKL;text5;text6;text7
有 3 个命名列。额外的未命名列都与最后一列(info)相关,并且这些额外列的数量未知。
由于形状不规则,使用df=pd.read_csv(filename, delimiter=";", dtype=object) 返回"Error tokenizing data. C error..."。
是否可以将最后一列合并为包含列表的一列,以实现以下结果?
ID;name;info
1;ABC;[text1]
2;DEF;[text2, text3]
3;GHI;[text4]
4;JKL;[text5, text6, text7]
【问题讨论】:
-
扫描文件,确定最大字段数(5,即您的示例中的2个),通过在最顶部的行中添加field4和field5来修改文件,然后导入。之后,您可以通过多种方式之一组合列stackoverflow.com/questions/52276658/…