【问题标题】:How to index with ELKI - OPTICS clustering如何使用 ELKI 进行索引 - OPTICS 聚类
【发布时间】:2015-12-20 21:15:09
【问题描述】:

我是 ELKI 初学者,我一直在使用它从 .csv 文件中聚集大约 10K 经纬度点。一旦我的设置正确,我想放大到 1MM 点。

我正在使用带有 LngLatDistanceFunction 的 OPTICSXi 算法

我一直在阅读有关“使用 STR 批量加载启用 R*-tree 索引”的内容,以便看到性能的巨大改进。教程对我帮助不大。

关于如何实现此功能的任何提示?

【问题讨论】:

  • 使用-db.index 参数添加索引。使用批量加载选项,配置批量加载。

标签: cluster-analysis data-mining elki optics-algorithm


【解决方案1】:

在二维数据上使用空间 R* 索引的建议参数是:

-db.index tree.spatial.rstarvariants.rstar.RStarTreeFactory
-pagefile.pagesize 512
-spatial.bulkstrategy SortTileRecursiveBulkSplit

对于更高维度的数据,需要更大的页面大小。 512-1024 字节的页面大小似乎是二维数据的最佳选择,但这也取决于您的数据。

要离散化集群,您可以使用 Xi 提取:

-algorithm clustering.optics.OPTICSXi -opticsxi.xi 0.005

要从 OPTICS 的索引加速中受益,请为您的应用选择尽可能小的 epsilon。该参数以 meters 为单位,所有地球模型都在 ELKI 中。

-opticsxi.algorithm OPTICSHeap
-algorithm.distancefunction geo.LatLngDistanceFunction
-optics.epsilon 2000.0 -optics.minpts 10

最多使用 2 公里的距离。

确保区分latitude,longitudelongitude,latitude。两个订单都使用了,您需要使用正确的距离函数:

geo.LatLngDistanceFunction
geo.LngLatDistanceFunction

【讨论】:

  • 谢谢!为了那些关注的人的利益,这是我正在执行的,它似乎在我的特定数据集上运行良好:java -jar cli -algorithm clustering.optics.OPTICSXi -dbc.in -db.index tree.spatial.rstarvariants.rstar.RStarTreeFactory -pagefile.pagesize 1024 -spatial.bulkstrategy SortTileRecursiveBulkSplit -opticsxi.xi 0.006 -optics.minpts 5 -algorithm.distancefunction geo.LngLatDistanceFunction -geo.model WGS84SpheroidEarthModel -opticsxi.algorithm OPTICSHeap -resulthandler 结果出
猜你喜欢
  • 2016-08-14
  • 2012-12-11
  • 1970-01-01
  • 1970-01-01
  • 2013-04-16
  • 2021-07-21
  • 2016-02-11
  • 2015-07-15
  • 2013-03-07
相关资源
最近更新 更多