【问题标题】:how to cache random forest models in spark如何在火花中缓存随机森林模型
【发布时间】:2018-11-05 23:51:15
【问题描述】:

我的平台是spark 2.1.0,使用python语言。

现在我有大约 100 个随机森林多分类模型,我将它们保存在 HDFS 中。HDFS 中也保存了 100 个数据集。 我想使用相应的模型来预测数据集。如果模型和数据集都缓存在内存中,预测会快10倍以上。

但是我不知道如何缓存模型,因为模型不是RDD或Dataframe。

谢谢!

【问题讨论】:

    标签: apache-spark machine-learning random-forest


    【解决方案1】:

    TL;DR只需cache 数据,如果它曾在预测过程之外重复使用,如果没有,您甚至可以跳过。

    RandomForestModel 是一个不受分布式数据结构支持的本地对象,没有需要重新计算的DAG,预测过程是一个简单的、仅限地图的工作。因此模型不能被缓存,即使能缓存,操作也毫无意义。

    另见(Why) do we need to call cache or persist on a RDD

    【讨论】:

      猜你喜欢
      • 2016-10-26
      • 2016-07-23
      • 1970-01-01
      • 2020-02-25
      • 2019-07-10
      • 2017-08-11
      • 2016-09-16
      • 2016-01-15
      • 2016-04-09
      相关资源
      最近更新 更多