【发布时间】:2020-10-16 19:07:03
【问题描述】:
我正在尝试对我的数据集进行聚类。我的数据集中有 700k 行。我从中拿了 40k 并尝试在 python 和 sklearn 中进行 DBSCAN 聚类。我在 32 GB 内存上运行。该算法运行了一整夜,但没有完成,我随后手动停止了程序。
但是当我尝试使用 10k 数据集时,它正在运行。
DBSCAN 对数据集大小有什么限制吗?
我使用了以下代码:
clustering = DBSCAN().fit(df)
pred_y = clustering.labels_
还有以下版本:
clustering = DBSCAN(eps=9.7, min_samples=2, algorithm='ball_tree', metric='minkowski', leaf_size=90, p=2).fit(df)
pred_y = clustering.labels_
如何在我的数据集中使用 DBSCAN 聚类?
【问题讨论】:
标签: python machine-learning scikit-learn cluster-analysis dbscan