【问题标题】:how to find sum of entire column data in pyspark RDD?如何在pyspark RDD中找到整列数据的总和?
【发布时间】:2020-06-20 13:22:47
【问题描述】:

我有 5 列的制表符分隔文本数据,我需要找出第 4 列的总和。

# Find the total sales values:

from pyspark import SparkContext, SparkConf

if __name__ == '__main__':
    conf = SparkConf().setAppName("sales").setMaster("local[2]")

    sc = SparkContext(conf=conf)

    sales = sc.textFile("C:\\Users\\Desktop\\Retail_Sample_Data_Set.txt")
    result = sales.map(lambda line: line.split("\t")[4])

我使用 sum () 并按键减少,但对我没有任何作用。请帮帮我?

【问题讨论】:

  • 我建议使用dataframe apis

标签: apache-spark hadoop pyspark rdd


【解决方案1】:

map 转换中的 lambda 正在返回一个字符串。您可能需要使用类型转换。例如,如果第 5 列是 int,则将 map 中的 lambda 更改为 lambda line: int(line.split("\t")[4]),或者如果是 float,则将 lambda line: float(line.split("\t")[4])

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2022-09-30
    • 1970-01-01
    • 2019-12-27
    • 2018-08-10
    • 2020-12-06
    • 2016-11-12
    • 1970-01-01
    相关资源
    最近更新 更多