【问题标题】:Unsupervised discretization to convert continuous into categorical for frequent item set mining无监督离散化将连续转换为分类以进行频繁项集挖掘
【发布时间】:2018-01-31 00:44:52
【问题描述】:

我正在使用“arules”包来挖掘我的大数据中的频繁项集,但我找不到合适的离散化方法。

作为“arules”包中的示例,可以在“离散化”函数中使用几种基本的无监督方法,但是我想在我的大型数据集中估计最佳类别数,这似乎比分配类别数更合理.

你能给我一些好的建议吗,谢谢。

@Michael Hahsler

【问题讨论】:

    标签: r transactions cluster-analysis arules discretization


    【解决方案1】:

    我认为关于无监督离散化的指导很少。查看每个变量的直方图并手动决定。对于 k-means,您可能会使用内部验证技术(即肘部方法)来使用策略来找到 k。对于有监督的离散化,有一些方法可以帮助您做出决定。也许其他人可以在这里提供帮助。

    【讨论】:

    • 感谢回复,我的数据太大了,所以当我使用k-means时,有警告信息:Quick-TRANSfer stage steps exceeded maximum (= 93441300)
    • 取样,使用onlycuts=TRUE 应用k-means 离散化,然后使用fixed 方法对所有数据返回切割。
    • 谢谢你的回复,在你的方法中,我必须估计最佳类别数,对吗?
    • 是的,你必须指定数字。
    猜你喜欢
    • 2014-01-25
    • 2014-02-11
    • 2018-11-06
    • 2011-03-04
    • 2016-05-02
    • 2011-10-26
    • 2021-08-04
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多