【发布时间】:2016-09-15 15:59:39
【问题描述】:
鉴于以下 rdd
training_rdd = rdd.select(
# Categorical features
col('device_os'), # 'ios', 'android'
# Numeric features
col('30day_click_count'),
col('30day_impression_count'),
np.true_divide(col('30day_click_count'), col('30day_impression_count')).alias('30day_click_through_rate'),
# label
col('did_click').alias('label')
)
我对训练梯度提升分类器的语法感到困惑。
但是,我不确定如何将我的 4 个特征列放入一个向量中。因为 VectorIndexer 假定所有特征都已经在一个列中。
【问题讨论】:
-
链接教程假定
DataFrame,但不是RDD。
标签: apache-spark pyspark apache-spark-ml