【发布时间】:2015-05-27 17:34:32
【问题描述】:
我正在试验 spark.ml 库和管道功能。使用带有拆分的 SQL 似乎存在限制(例如,用于训练和测试):
- spark.ml 在模式 rdd 上工作很好,但没有简单的方法可以在测试和训练集中随机拆分模式 rdd。我可以使用 randomSplit(0.6,0.4) 但这会返回一个丢失模式的 RDD 数组。我可以在其上强制一个案例类并将其转换回模式 RDD,但我有很多功能。我使用了过滤器并使用了一些基于我的 iid 功能的基本分区条件)。还有什么可以做的建议吗?
关于生成的模型:
- 如何访问模型权重? lr 优化器和 lr 模型内部具有权重,但不清楚如何使用它们。
【问题讨论】:
-
似乎是一对合理的问题:我在 mllib 上工作并且理解它们(尽管还没有答案)。鉴于票数接近,我将编辑问题以查看其他人是否可以同意。
标签: apache-spark apache-spark-sql