【问题标题】:spark pipeline vector assembler drop other columns火花管道矢量汇编器删除其他列
【发布时间】:2017-03-24 23:55:16
【问题描述】:

火花VectorAssembler http://spark.apache.org/docs/latest/ml-features.html#vectorassembler 产生以下输出

id | hour | mobile | userFeatures     | clicked | features
----|------|--------|------------------|---------|-----------------------------
 0  | 18   | 1.0    | [0.0, 10.0, 0.5] | 1.0     | [18.0, 1.0, 0.0, 10.0, 0.5]

如您所见,最后一列包含所有以前的功能。如果删除其他列是否更好/性能更高,例如仅保留标签/id 和特征,或者这是不必要的开销,只需将标签/id 和特征输入估计器就足够了?

在管道中使用VectorAssembler 时会发生什么?如果不手动删除原始列,将只使用最后一个特征还是会引入共线性(重复列)?

【问题讨论】:

  • 请解释为什么投反对票。

标签: apache-spark vector pipeline apache-spark-mllib


【解决方案1】:

请仔细阅读文档。每个分类器都由特征列 (featuresCol) 参数化。它不考虑任何其他列或列的顺序。

【讨论】:

    猜你喜欢
    • 2023-03-11
    • 2022-01-05
    • 1970-01-01
    • 1970-01-01
    • 2017-05-16
    • 1970-01-01
    • 2017-06-05
    • 1970-01-01
    • 2022-01-22
    相关资源
    最近更新 更多