【问题标题】:set max-memory parameter in pyspark mllib random forest在 pyspark mllib 随机森林中设置最大内存参数
【发布时间】:2018-05-19 12:10:15
【问题描述】:

我使用RandomForest MLlib PySpark 2.3。如何设置MaxMemoryInMb?据我所知,这种方法在 PySpark 2.3 中没有实现。

我问是因为我在实验中收到了以下警告:

WARN RandomForest: Tree learning is using approximately 724037600 
bytes per iteration, which exceeds requested limit
maxMemoryUsage=268435456. This allows splitting 1 nodes in this iteration.

【问题讨论】:

  • 请同时包含代码,并将输出放在代码框中,不要加粗。
  • 我的数据包括 5000000 个实例。我的代码的输出没有得到错误,但是这个 WARN 导致足够了。

标签: pyspark apache-spark-mllib random-forest


【解决方案1】:

使用pypark.mlsetMaxMemoryInMB

setMaxMemoryInMB(值) 设置 ma​​xMemoryInMB 的值。

maxMemoryInMB parameter

class pyspark.ml.classification.DecisionTreeClassifier(self, ..., maxMemoryInMB=256, ...)

自 Spark 1.4 的初始版本和 setMaxMemoryInMB 所属的位置以来,PySpark 中存在。

pyspark.mllib 被冻结(不会添加新功能),内部使用pyspark.ml.

【讨论】:

    猜你喜欢
    • 2020-10-18
    • 2017-04-14
    • 2015-05-03
    • 2015-05-12
    • 2015-12-13
    • 2016-01-28
    • 2020-05-16
    • 2015-03-02
    • 2019-02-16
    相关资源
    最近更新 更多