【发布时间】:2022-08-06 03:38:57
【问题描述】:
在 python pandas 中,当我有这样的 dataframe df
| c1 | c2 | c3 |
|---|---|---|
| 0.1 | 0.3 | 0.5 |
| 0.2 | 0.4 | 0.6 |
我可以使用df.corr() 来计算相关矩阵。
我如何用 scala 在 spark 中做到这一点?
我看过官方文档,数据结构和上面的不一样。我不知道如何转移它。
更新一:
val df = Seq(
(0.1, 0.3, 0.5,0.6,0.8,0.1, 0.3, 0.5,0.6,0.8),
(0.2, 0.4, 0.6,0.7,0.7,0.2, 0.4, 0.6,0.7,0.7),
).toDF(\"c1\", \"c2\", \"c3\",\"c4\",\"c5\",\"c6\", \"c7\", \"c8\",\"c9\",\"c10\")
val assembler = new VectorAssembler().setInputCols(Array(\"c1\", \"c2\", \"c3\",\"c4\",\"c5\",\"c6\", \"c7\", \"c8\",\"c9\",\"c10\")).setOutputCol(\"vectors\")
当列数为 10 时如何显示整个结果?
-
不 。它使用
pyspark而我想要一个scala spark答案。 -
看看这个 scala 解决方案:spark.apache.org/docs/latest/ml-statistics.html
-
看看stackoverflow.com/a/70411405/6802156。从 DF 构建 RowMatrix 后,它立即
-
我已经阅读了文档,它的数据框结构和我的不一样...
标签: scala apache-spark pyspark