【发布时间】:2018-07-24 13:31:18
【问题描述】:
我的PipelinedRDD 中有一列名义值,我想将其转换为索引编码以进行分类。
我以前在pyspark.ml 中使用过StringIndexer,非常好用。不过这次是学习如何处理rdd而不是dataframe,而pyspark.mllib中没有这种东西。
感谢任何帮助。
【问题讨论】:
-
字符串索引器不适用于基于 RDD 的 API。但是,当 Dataframe 更快时,为什么还要将它用于 RDD 呢?
标签: python apache-spark pyspark rdd apache-spark-mllib