【发布时间】:2016-06-02 10:52:29
【问题描述】:
对于数据链接,尤其是 R RecordLinkage package,我比较陌生。我有如下数据:
require(RecordLinkage)
library(RCurl)
dss_member <- read.csv(text = getURL("https://raw.githubusercontent.com/kilimba/data/master/dss_member.csv"),
stringsAsFactors = F)
dss_member$id <- NULL
patient <- read.csv(text = getURL("https://raw.githubusercontent.com/kilimba/data/master/patient.csv"),
stringsAsFactors = F)
patient$id <- NULL
rpairs <- compare.linkage(patient,dss_member)
rpairs$pairs
rpairs <- epiWeights(rpairs)
summary(rpairs)
如您所见,我有两个数据框,dss_member(11 行)和patient(5 行)。我在其中插入了一行 应该 理论上肯定是一个链接,用户 James Earl Jones。但是我有两个担忧。
rpairs$pairs行导致输出,其中最后一列is_match始终显示为 NA,即使我确信两个数据集中至少有一行相同。这是什么意思?这与another SO question 有关,尚未得到答复。-
线条
rpairs <- epiWeights(rpairs)summary(rpairs)
给出如下结果:
Linkage Data Set
5 records in data set 1
11 records in data set 2
55 record pairs
0 matches
0 non-matches
55 pairs with unknown status
Weight distribution:
[0,0.2] (0.2,0.4] (0.4,0.6] (0.6,0.8] (0.8,1]
47 1 3 2 2
(a) 为什么它显示 0 个匹配项和 0 个不匹配项,而 肯定 至少匹配(詹姆斯厄尔琼斯)
(b) 函数compare.linkage() 中的identity 参数是可选的吗?如果是这样,当你把它放在外面和放进去时会发生什么?
(c) 即使在没有“黄金标准”的情况下也可以使用此软件包来执行记录链接,并且不记录链接评估?
亲切的问候, 图马尼
【问题讨论】:
标签: r duplicates record linkage data-linking