【发布时间】:2020-08-06 12:26:25
【问题描述】:
我正在尝试训练一个 k-means 模型,目前正在检查我的特征向量中的相关性。
当我针对我的特征向量运行 pearson 相关时,我无法看到所有特征的结果。
我运行的代码是:
val cor = Correlation.corr(scoringDf, "features")
cor.show(false)
相关性运行良好,但是当我尝试使用 show 方法查看结果时(因为 Correlation.corr 返回一个 Datafame 对象),结果显示为
|1.0 0.18047211468479446 0.08002566273874058 ... (5 total)
0.18047211468479446 1.0 0.02926796076983553 ...
0.08002566273874058 0.02926796076983553 1.0 ...
0.30256416877032244 0.15974389490583188 0.054692657400425136 ...
0.3408783412055776 0.13008391583866225 0.04241296238931376 ...|
有没有办法查看隐藏的列?
我也试过下面的代码,但结果是一样的。
val Row(coeff1: Matrix) = Correlation.corr(scoringDf, "features").head
println(s"Pearson correlation matrix:\n $coeff1")
编辑:
这里是 cor 数据框的架构
root
|-- pearson(features): matrix (nullable = false)
【问题讨论】:
标签: scala apache-spark apache-spark-sql pearson-correlation