【发布时间】:2018-07-16 06:31:20
【问题描述】:
以下是我的dataframe:
df = spark.createDataFrame([
(0, 1),
(0, 2),
(0, 5),
(1, 1),
(1, 2),
(1, 3),
(1, 5),
(2, 1),
(2, 2)
], ["id", "product"])
我需要做一个groupBy 的id 并收集所有项目,如下所示,但我需要检查产品数量,如果它小于2,那不应该在那里收集项目。
例如,产品 3 仅重复一次,即 3 的计数为 1,小于 2,因此它不应在以下数据帧中可用。看来我需要做两个groupBys:
预期输出:
+---+------------+
| id| items|
+---+------------+
| 0| [1, 2, 5]|
| 1| [1, 2, 5]|
| 2| [1, 2]|
+---+------------+
【问题讨论】:
-
在哪个模块/库/包中找到 spark.createdataframe 函数?
标签: python python-3.x apache-spark pyspark apache-spark-sql