【发布时间】:2016-01-12 10:15:45
【问题描述】:
我有两个文件。第一个文件包含三列:SiteID、Time 和 ClusterNo。
第二个文件有四列:SiteA_ID、SiteB_ID、Time 和 ClusterNo。
file1 <- data.frame("Site_ID" = sample(74000:74500, 1000, replace =TRUE), "Time" = runif(1000)*100, "ClusterNo." = sample(1:500, 1000, replace = TRUE))
file2 <- data.frame("SiteA_ID" = sample(74000:74500, 1000, replace =TRUE),"SiteB_ID" = sample(74000:74500, 1000, replace =TRUE), "Time" = runif(1000)*100, "ClusterNo." = sample(1:500, 1000, replace = TRUE))
我们必须找出(file1 和 file2 的)哪些集群以 file1 的 Site_ID 与 file2 的 Site(A 或 B)匹配的方式进行映射; file1和file2的时间相差不超过2个单位。
所需的输出是一个包含三列的文件:ClusterNoOfFile1 和 ClusterNoOfFile2 和 CommonSite
[注意:CommonSite 是file1 和file2 的集群映射的公共站点]
【问题讨论】:
标签: r data-manipulation