【发布时间】:2021-04-16 14:37:56
【问题描述】:
我有一个巨大的标题列表。我想计算整个数据集中的每个标题。例如:
`title`
A
b
A
c
c
c
输出:
title fre
A 2
b 1
c 3
我正在寻找一种在 Hadoop 中使用 reduce 函数的快速方法。我知道以下方式:
import pyspark.sql.functions as f
df.groupBy('title').agg(f.count('*').alias('count')).show()
我还需要获得出现次数少于 10 次的标题。
【问题讨论】:
标签: apache-spark hadoop pyspark count reduce