【发布时间】:2018-11-05 23:51:15
【问题描述】:
我的平台是spark 2.1.0,使用python语言。
现在我有大约 100 个随机森林多分类模型,我将它们保存在 HDFS 中。HDFS 中也保存了 100 个数据集。 我想使用相应的模型来预测数据集。如果模型和数据集都缓存在内存中,预测会快10倍以上。
但是我不知道如何缓存模型,因为模型不是RDD或Dataframe。
谢谢!
【问题讨论】:
标签: apache-spark machine-learning random-forest