【发布时间】:2016-10-26 08:38:50
【问题描述】:
我正在处理一个必须使用 mllib 库的分类问题。 mllib 中的分类算法(比如说逻辑回归)需要一个 RDD[LabeledPoint]。 LabeledPoint 只有两个字段,一个标签和一个特征向量。在进行评分时(在测试集上应用我训练过的模型),我的测试实例还有一些我想保留的其他字段。例如,一个测试实例看起来像这样<id, field1, field2, label, features>。当我创建 LabeledPoint 的 RDD 时,所有其他字段(id、field1 和 field2)都消失了,我无法在我的得分实例和原始实例之间建立关系。我该如何解决这个问题。评分后,我需要知道 ids 和 score/predicted_label。
这个问题在 ML 中不存在,因为它使用 DataFrame,我可以简单地在我的原始数据框中添加另一个带有分数的列。
【问题讨论】:
标签: apache-spark apache-spark-mllib