【发布时间】:2019-06-20 11:16:36
【问题描述】:
解释我的问题不同:这个问题与标记的问题不同。首先,输入参数已经是一个目录(这是正确的但标记的问题是错误的)。其次,我在流运行期间将txt文件复制到目录中以模拟新的txt文件到达(因此生成新文件而不是该目录中存在的相同文件)
下面是我的问题
我有一个目录和txt文件/tmp/a.txt,文件中的内容是
aaa
bbb
我使用 pyspark 并手动将此文件复制到同一目录中,连续(在流式运行期间文件同时创建)
def count(x):
if x.isEmpty:
print("empty")
return
print(x.count())
sc = SparkContext()
ssc = StreamingContext(sc, 3)
ssc.textFileStream("/tmp/").foreachRDD(count)
输出显示RDD为空
我怎么用
c = sc.textFile("/tmp/").count()
print(c)
显示c为2(与txt文件内容一致)
为什么流媒体不起作用?
【问题讨论】:
-
@user10938362 不重复,已添加说明
标签: apache-spark pyspark spark-streaming