【发布时间】:2015-07-09 04:49:34
【问题描述】:
我正在尝试从 apache Spark 的 mlib 库中进行 kmeans 聚类算法。我已经完成了所有设置,但我不确定如何格式化输入数据。我对机器学习比较陌生,所以任何帮助都将不胜感激。
在示例 data.txt 中,数据如下:
0.0 0.0 0.0
0.1 0.1 0.1
0.2 0.2 0.2
9.0 9.0 9.0
9.1 9.1 9.1
9.2 9.2 9.2
我要运行算法的数据现在是这种格式(json数组):
[{"customer":"ddf6022","order_id":"20031-19958","asset_id":"dd1~33","price":300,"time":1411134115000,"location":"bt2"},{"customer":"ddf6023","order_id":"23899-23825","asset_id":"dd1~33","price":300,"time":1411954672000,"location":"bt2"}]
如何将其转换为可与 k-means 聚类算法一起使用的东西?我正在使用 Java,我猜我需要它是 JavaRDD 格式,但不知道如何去做。
【问题讨论】:
标签: java algorithm machine-learning apache-spark