【发布时间】:2017-03-15 15:54:03
【问题描述】:
问题:
大量文件。每个文件为 10MB,由 json 格式的记录组成,gzip 压缩。
我的 sn-p 正在将所有数据加载到内存中。没有必要这样做。我一次只需要几个小时的内存数据。我需要一个滑动窗口。
是否可以将火花流中的“窗口”想法应用到文件中,我将如何做到这一点?
我正在使用 python
location = "s3://bucketname/xxxx/2016/10/1[1-2]/*/file_prefix*.gz"
rdd = sc.textFile(location)
【问题讨论】:
-
如果你知道需要加载哪些数据,你可以使用
filter,因为spark中的所有转换都是惰性的,它只加载过滤后的数据。 -
好的,这真的很有帮助。我仍然认为我最终仍需要应用某种窗口。我有相当多的数据。压缩后的大小约为 300GB。
-
Spark 流支持滑动窗口功能,请查看spark.apache.org/docs/latest/…
-
你想在 Spark Core 中应用滑动窗口的概念吗?
-
不知道能不能用
ssc.textFileStream("/file/path")
标签: python apache-spark iterator sliding-window