【发布时间】:2017-03-24 23:55:16
【问题描述】:
火花VectorAssembler http://spark.apache.org/docs/latest/ml-features.html#vectorassembler 产生以下输出
id | hour | mobile | userFeatures | clicked | features
----|------|--------|------------------|---------|-----------------------------
0 | 18 | 1.0 | [0.0, 10.0, 0.5] | 1.0 | [18.0, 1.0, 0.0, 10.0, 0.5]
如您所见,最后一列包含所有以前的功能。如果删除其他列是否更好/性能更高,例如仅保留标签/id 和特征,或者这是不必要的开销,只需将标签/id 和特征输入估计器就足够了?
在管道中使用VectorAssembler 时会发生什么?如果不手动删除原始列,将只使用最后一个特征还是会引入共线性(重复列)?
【问题讨论】:
-
请解释为什么投反对票。
标签: apache-spark vector pipeline apache-spark-mllib