【发布时间】:2015-10-12 20:44:49
【问题描述】:
我有一个如下所示的 CSV 文件
S1, 22, MD , 0.022, , 523.324
S2, 22, MD , 4.32, , 342.54
S3, 22, MD , 3.54, , 0.32
S4, 22, MD , 4.32, , 0.54
S1, 33, MD , 5.32, , 0.43
S2, 33, MD , 11.54, , 0.65
S3, 33, MD , 22.5, , 0.324
S4, 33, MD , 45.89 , 0.32
S1, 44, MD , 3.53 , 3.32
S2, 44, MD , 4.5 , 0.322
S3, 44, MD , 43.65 , 45.78
S4, 44, MD, 43.54 , 0.321
该文件没有任何标题,但我不关心 MD 列
我的输出文件需要如下所示:
Size , S1` , S2 , S3 , S4
22 , 0.022 , 4.32 , 45.89 , 4.32
33 , 5.32, 11.54 , 22.5, 45.89,
44 , 3.53, 4.5, 43.65, 43.54
3 values, 3 values, 3,values, 3 values
如您所见,输出文件包含标题。最后一行还表示每列中值的总数。
到目前为止我的代码:
将熊猫导入为 pd
将 numpy 导入为 np
导入 csv
df=pd.read_csv(r'C:\Users\testuser\Desktop\file.csv',usecols=[0,1,2,3,4])
df.columns=pd.MultiIndex.from_tuples(zip(['Names','FileSize','x','y','z'],df.columns)) #add 列标题。 ..(这做的不对)
df_out=df.groupby('Names','FileSize').count().reset_index() #假设打印不同的值
df_out.to_csv('processed_data_out.csv', columns['Names','FileSize','x','y','z'], header=False,index=False)
我没有使用输出中的最后一列,因为如果用户要求查看该信息,则应该生成该列。我又遇到了麻烦。
【问题讨论】:
-
到目前为止您尝试/做了什么?还有你的 csv 逗号或空格分隔吗?
-
您已经描述了您的文件并解释了您的要求,但您的问题是什么?
-
您好,欢迎来到 StackOverflow。请花一些时间阅读帮助页面,尤其是名为"What topics can I ask about here?" 和"What types of questions should I avoid asking?" 的部分。更重要的是,请阅读the Stack Overflow question checklist。您可能还想了解Minimal, Complete, and Verifiable Examples。
-
好的对不起。我很着急。我尝试过使用 pandas,但它正在查看所有列,而不仅仅是 TSD 和 REEquirement 列。
-
我也为那些听不懂的人编辑了我的问题
标签: python python-2.7 parsing csv numpy