【发布时间】:2018-08-11 15:09:37
【问题描述】:
我有两个输入数据帧,格式为:
Word colA colB colC ID
python A B C 1
word D E F 1
of G H I 1
python J K L 2
is M N O 2
of P Q R 3
另一种格式为:
V1 V2 V3 V4
the 0.1 0.2 0.3
python 0.4 0.5 0.6
excel 0.6 0.7 0.8
is 0.9 0.10 0.6
access 0.7 0.5 0.6
of 0.5 1.2 7.8
tell 0.9 3.2 4.5
pandas 0.5 0.4 0.3
让我们调用第一个数据帧 df1 和第二个数据帧 df2。
我想知道如何根据 V1 对具有与 df1['Word'] 相同术语的 df2 进行子集化。如果 V1 中的术语在 df1['Word'] 中没有匹配项,我希望行用零填充。另外,另一个关键点是我想包含重复项。我还想将“ID”列复制到 df2 数据框。
我的预期输出将采用以下格式:
V1 V2 V3 V4 ID
python 0.4 0.5 0.6 1
word 0.0 0.0 0.0 1
of 0.5 1.2 7.8 1
python 0.4 0.5 0.6 2
is 0.9 0.10 0.6 2
of 0.5 1.2 7.8 3
我能够成功识别输出数据框中的术语并对其进行子集化,而不会显示重复项。但是包括重复的术语对我来说有点挑战。我还需要帮助才能成功地将 df1['ID'] 列复制到输出数据帧的末尾。
如果能得到任何帮助,我将不胜感激。
谢谢。
【问题讨论】:
标签: python python-3.x pandas dataframe