【发布时间】:2017-09-25 12:23:45
【问题描述】:
将 StringIndexer 应用于包含以下列的 df_notnull(DataFrame 对象)时:
scala> df_notnull.printSchema
root
|-- L0_S22_F545: string (nullable = true)
|-- L0_S0_F0: double (nullable = true)
|-- L0_S0_F2: double (nullable = true)
|-- L0_S0_F4: double (nullable = true)
只剩下那些了:
scala> indexed.printSchema
root
|-- L0_S22_F545: string (nullable = true)
|-- L0_S22_F545Index: double (nullable = true)
这是我的代码:
:paste
import org.apache.spark.ml.feature.{OneHotEncoder, StringIndexer}
val indexer = new StringIndexer()
.setInputCol("L0_S22_F545")
.setOutputCol("L0_S22_F545Index")
val indexed = indexer.fit(df_notnull).transform(df_notnull)
indexed.printSchema
我想保留所有列,只添加一些新列。我做错了什么?
【问题讨论】:
标签: apache-spark apache-spark-sql apache-spark-ml