【发布时间】:2017-08-07 03:03:13
【问题描述】:
我在 Hive 有火车设置表。一共有600列,0~599列是年龄、性别……最后一列是0和1的标签。 我将表格读取为 df 并且 df 也有 600 列。
但我发现在 spark(python) 的文档中,模型像随机森林,只接受 libsvm 格式的数据。
data = spark.read.format("libsvm").load("data/mllib/sample_libsvm_data.txt")
所以我想知道 MLLib 是否只接受 libsvm 数据格式? 如果是这样,我如何将我的数据集转换为 libsvm 格式,因为我的数据集是存储为 hive 表的分布数据。
谢谢
【问题讨论】:
标签: apache-spark pyspark spark-dataframe apache-spark-mllib