【发布时间】:2015-01-16 02:57:11
【问题描述】:
我只想计算 spark (pyspark) 中的单词,但我可以映射字母或整个字符串。
我试过了: (整串)
v1='Hi hi hi bye bye bye word count'
v1_temp=sc.parallelize([v1])
v1_map = v1_temp.flatMap(lambda x: x.split('\t'))
v1_counts = v1_map.map(lambda x: (x, 1))
v1_counts.collect()
或(只是字母)
v1='Hi hi hi bye bye bye word count'
v1_temp=sc.parallelize(v1)
v1_map = v1_temp.flatMap(lambda x: x.split('\t'))
v1_counts = v1_map.map(lambda x: (x, 1))
v1_counts.collect()
【问题讨论】:
-
好吧,这里的问题与 Spark 无关,您尝试按制表符拆分:
split('\t'),而您需要的是简单地调用split()。
标签: python count mapreduce apache-spark pyspark