【问题标题】:Spark Kafka WordCount PythonSpark Kafka WordCount Python
【发布时间】:2015-07-25 11:46:25
【问题描述】:

我刚刚开始使用 apache spark 并尝试让 kafka 字数在 python 中工作。我决定使用 python 作为一种语言,我可以将其用于其他大数据技术,而且 DataBricks 正在通过 spark 提供他们的课程。

我的问题: 我从这里运行基本的字数统计示例:https://github.com/apache/spark/blob/master/examples/src/main/python/streaming/kafka_wordcount.py 它似乎开始并连接到 kafka 日志,但我看不到它实际上会产生字数。然后我添加了下面的行来写入一个文本文件,它只会产生一堆空的文本文件。它正在连接到 kafka 主题并且主题中有数据,如果有的话,我如何才能看到它对数据的实际作用?会不会是时间问题?干杯。

处理kafka数据的代码

                counts = lines.flatMap(lambda line: line.split("|")) \
                    .map(lambda word: (word, 1)) \
                    .reduceByKey(lambda a, b: a+b) \
                    .saveAsTextFiles("sparkfiles")

Kafka 主题中的数据

                    16|16|Mr|Joe|T|Bloggs

【问题讨论】:

    标签: python apache-spark apache-kafka spark-streaming pyspark


    【解决方案1】:

    对不起,我是个白痴。当我为主题生成数据时在 spark 应用程序运行时我可以在输出中看到以下内容

                    (u'a', 29)
                    (u'count', 29)
                    (u'This', 29)
                    (u'is', 29)
                    (u'so', 29)
                    (u'words', 29)
                    (u'spark', 29)
                    (u'the', 29)
                    (u'can', 29)
                    (u'sentence', 29)
    

    这表示每个单词在刚刚被 spark 处理的块中表示了多少次。

    【讨论】:

      猜你喜欢
      • 2018-09-19
      • 1970-01-01
      • 1970-01-01
      • 2018-12-25
      • 1970-01-01
      • 1970-01-01
      • 2016-10-26
      • 1970-01-01
      • 2015-08-01
      相关资源
      最近更新 更多