【发布时间】:2019-06-06 05:13:14
【问题描述】:
我有这个数据科学问题,我需要使用两个 csv 文件中提供的信息创建一个测试集。
问题
data1.csv
猫,In1,In2
aaa, 0, 1
aaa, 2, 1
aaa, 2, 0
aab, 3, 2
aab, 1, 2
data2.csv
猫,索引,属性1,属性2
aaa, 0, 150, 450
aaa, 1, 250, 670
aaa, 2, 30, 250
aab, 0, 60, 650
aab, 1, 50, 30
aab, 2, 20, 680
aab, 3, 380, 250
从这两个文件中,我需要一个更新的 data1.csv 文件。在 In1 和 In2 的地方,我需要特定类别(cat)下的特定索引(In1 和 In2)的属性。
注意:特定类别(猫)中的所有索引都有自己的属性。
结果应该是这样的,
updated_data1.csv
猫,In1a1,In1a2,In2a1,In2a2
aaa, 150, 450, 250, 670
aaa, 30, 250, 250, 670
aaa, 30, 250, 150, 450
aab, 380, 250, 20, 680
aab, 50, 30, 20, 680
我需要一种在 python 中使用 pandas 来解决这个问题的方法。到目前为止,我已将 csv 文件加载到我的 jupyter 笔记本中。而且我不知道从哪里开始。
请注意,这是我使用 python 进行数据操作的第一周,我对 python 知之甚少。也请原谅我丑陋的格式。我正在用手机输入这个问题。
【问题讨论】:
-
查看和研究
pd.merge()以及不同类型的合并。 pandas.pydata.org/pandas-docs/stable/reference/api/…
标签: python pandas csv dataframe