【发布时间】:2020-10-29 00:20:51
【问题描述】:
我尝试对一些混合类型的数据运行梯度提升树算法:
[('feature1', 'bigint'),
('feature2', 'int'),
('label', 'double')]
我尝试了以下
from pyspark.mllib.tree import GradientBoostedTrees, GradientBoostedTreesModel
from pyspark.ml.feature import VectorAssembler
from pyspark.mllib.linalg import Vector as MLLibVector, Vectors as MLLibVectors
from pyspark.mllib.regression import LabeledPoint
vectorAssembler = VectorAssembler(inputCols = ["feature1", "feature2"], outputCol = "features")
data_assembled = vectorAssembler.transform(data)
data_assembled = data_assembled.select(['features', 'label'])
data_assembled = data_assembled.select(F.col("features"), F.col("label"))\
.rdd\
.map(lambda row: LabeledPoint(MLLibVectors.fromML(row.label), MLLibVectors.fromML(row.features)))
(trainingData, testData) = data_assembled.randomSplit([0.9, 0.1])
model = GradientBoostedTrees.trainRegressor(trainingData,
categoricalFeaturesInfo={}, numIterations=100)
但是我收到以下错误:
TypeError: Unsupported vector type <class 'float'>
但我的类型实际上都不是浮动的。此外,如果相关,feature2 是二进制的。
【问题讨论】:
标签: pyspark apache-spark-mllib