【发布时间】:2016-01-19 03:19:57
【问题描述】:
在Spark MLlib Guide 之后,我们可以看到 Spark 有两个机器学习库:
-
spark.mllib,建立在 RDD 之上。 -
spark.ml,建立在 Dataframes 之上。
根据 StackOverflow 上的 this 和 this 问题,数据帧比 RDD 更好(并且更新),应尽可能使用。
问题是我想使用常见的机器学习算法(例如:Frequent Pattern Mining,Naive Bayes等)和spark.ml(用于数据帧)不提供这种方法,只有spark.mllib(用于RDDs) 提供了这种算法。
如果 Dataframes 比 RDDs 更好,并且参考指南建议使用 spark.ml,为什么不在该库中实现常见的机器学习方法?
这里缺少什么?
【问题讨论】:
-
也与 StackOverflow 中的 Saving models 相关
-
这个问题其实很有意思,其实和Alberto提到的那个问题有关。您可以在 @zero323 的答案中找到您的答案。
-
迟到了,只是想补充一点,虽然主要的 Spark ML 在线文档没有提到它,但您可以在 API 文档中找到 NaiveBayes,您当然可以使用它。我是。
标签: machine-learning apache-spark pyspark apache-spark-mllib apache-spark-ml