【发布时间】:2018-11-23 11:32:10
【问题描述】:
我有一个格式如下的数据框:
Index | Feature1 | Feature2 | Feature3
21 5.0 1.0 6.0
5 4.0 2.0 3.0
但是对于 LDA().fit(df) 的输入,我需要一个格式如下的数据框:
id | features
21 [5.0, 1.0, 6.0]
5 [4.0, 2.0, 3.0]
我习惯于使用 Pandas,但对使用 PySpark 很陌生,找不到获得正确格式的好方法。有人可以帮忙吗?
【问题讨论】:
标签: python apache-spark pyspark apache-spark-sql lda