【发布时间】:2016-06-19 18:10:33
【问题描述】:
我有一个如下所示的数据框:
[ID_number,cust_number,feature1,feature2,feature3,....]
现在我想编写一个按 ID_number 分组的查询,并在子集上应用用户定义函数
[cust_number,feature1,feature2,feature3,......]
按每个 ID_number 分组 我需要对特征应用机器学习算法并以某种方式存储权重。
如何使用 Apache Spark DataFrames(使用 Scala)做到这一点?
【问题讨论】:
标签: scala apache-spark apache-spark-mllib spark-dataframe