【发布时间】:2017-08-26 15:10:17
【问题描述】:
我正在使用 R 并且有一个如下所示的数据集
[1, 2, 3, ""]
[1, 2, "", 4]
[1,"", "", ""]
我正在将这些值读入事务对象,然后将它们传递给 eclat 或 apriori 以进行频繁项集评估。当我的频繁项集如下所示时,问题就出现了:
{1,""}
{2,3,""}
我想从计算中删除这些行,因为我认为这会减慢处理速度,并且从预测的角度来看也没有任何意义。你能帮忙吗?我的 R 代码如下。
tr <- read.transactions("Items.csv", rm.duplicates=TRUE, format="basket",sep=",")
dataset1 <- as.vector(t(dataset1))
frequentItems <- eclat (tr, parameter = list(supp = 0.03, minlen=2, maxlen = 4))
inspect(frequentItems)
谢谢, 马特
【问题讨论】:
-
你的数据集的结构对于 R-folks 来说看起来很混乱。你能给我们提供一些我们可以自己尝试的代码,或者添加你的函数来自的包(那是
arules包,对吧?)
标签: r machine-learning apriori