【发布时间】:2017-03-20 09:39:33
【问题描述】:
我正在使用 Pyspark 和 JPMML 库从我的管道模型生成 PMML 模型。但我认为它不能正常生成。为了测试这一点,我使用相同的数据集和分类器创建了两个不同的管道模型,如下所示。
pipeline = Pipeline(stages = [assembler, slicer,pca, binarizer,assembler2, formula,classifier])
pipeline2 = Pipeline(stages = [assembler, slicer, binarizer,assembler2, formula,classifier])
但是当我使用以下代码 sn-p 生成 PMML 文件时,它会输出两个相同的文件。这意味着模型之间没有区别。我很迷惑。如果转换正确,生成的 PMML 文件应该会有所不同吧?
pipelineModel1 = pipeline.fit(df)
pmmlBytes = toPMMLBytes(spark, df, pipelineModel1)
with open('test.pmml','wb') as output:
output.write( pmmlBytes)
pipelineModel2 = pipeline2.fit(df)
pmmlBytes2 = toPMMLBytes(spark, df, pipelineModel2)
with open('test1.pmml','wb') as output:
output.write( pmmlBytes2)
【问题讨论】:
标签: apache-spark pyspark apache-spark-mllib apache-spark-ml pmml