【发布时间】:2018-03-13 16:24:24
【问题描述】:
我希望使用 Pyspark 语法将我的分类变量虚拟编码为如下图所示的数值变量。
我读入这样的数据
data = sqlContext.read.csv("data.txt", sep = ";", header = "true")
在 python 中,我可以使用以下代码对变量进行编码
data = pd.get_dummies(data, columns = ['Continent'])
但是我不确定如何在 Pyspark 中执行此操作。
任何帮助将不胜感激。
【问题讨论】:
标签: apache-spark encoding pyspark dummy-variable