【发布时间】:2014-09-11 10:09:36
【问题描述】:
我正在尝试寻找一种聚类算法来使用 python 对标称数据进行聚类。为此,我尝试了使用 RapidMiner 的 DBSCAN 算法,它适用于标称数据。但是当我使用 scikit-learn 提供的 DBSCAN 算法尝试相同的数据集时,它给出的错误是函数无法将字符串转换为浮点数。
rapidminer 和 scikit-learn 中的 DBSCAN 是否不同,我该如何解决这个问题? 另外,如果您告诉我另一种适用于名义数据的聚类算法会很棒吗?
【问题讨论】:
-
在使用 scikit learn 时,您需要将数据编码为一些数字数据类型,这取决于您对字符串值的解释。是值标签,您是否需要从字符串中提取特征,例如长度,tf-idf 等。一般看LabelEncoder 和preprocessing
标签: cluster-analysis data-mining scikit-learn rapidminer dbscan