【发布时间】:2020-03-22 10:20:38
【问题描述】:
我知道 Spark Structured Streaming 中的滑动窗口是事件时间窗口,它具有窗口大小(以秒为单位)和步长(以秒为单位)。
但后来我遇到了这个:
import org.apache.spark.mllib.rdd.RDDFunctions._
sc.parallelize(1 to 100, 10)
.sliding(3)
.map(curSlice => (curSlice.sum / curSlice.size))
.collect()
我不明白这一点。这里没有活动时间,那么sliding是做什么的?
如果我在 .map 行中发表评论,我会得到如下结果:
[I@7b3315a5
[I@8ed9cf
[I@f72203
[I@377008df
[I@540dbda9
[I@22bb5646
[I@1be59f28
[I@2ce45a7b
[I@153d4abb
...
像这样在简单的整数上使用mllib的滑动方法是什么意思? Jebrish 的价值观是什么?
【问题讨论】:
标签: scala apache-spark machine-learning apache-spark-mllib sliding-window