【发布时间】:2014-03-16 14:34:05
【问题描述】:
我有两个大数据框。 df1 有两列感兴趣的列(除其他外),它们是 A1 中的物种名称列表和 A2 中的 3 个字母区域列表。每一行都是一个独立的记录,因此值可能在两列中重复多次,并且有很多行(约 900 万行):
A1 A2 species A AFG species B THA species B LOP species C THA
我的第二个数据框 (df2) 基本上列出了一个物种应该出现的每个区域,因此对于每个值 B1,将有许多行,每行在 B2 中都有不同的值:
B1 B2 species A AFG species A FLO species B LOP species B PLA species C THA
我想要做的是将A2(df1)中给出的值与使用R的每个物种在B2(df2)中列出的值标准化。因此,对于df1中的每一行,如果A1中的值与B1相同, AND A2 与 B2 相同(如果 A1==B1 & A2==B2),保留该行。因此,在我上面的示例中,第 2 行将从 df1 中删除。
我尝试了以下但没有成功(没有删除行):
x
有什么建议吗?匹配函数会更合适吗?
这也是我在 Stack Overflow 上提出的第一个问题——如果不是很好,我很抱歉——欢迎任何关于如何改进问题的 cmets!
干杯!
【问题讨论】:
标签: r dataframe subset multiple-columns