【发布时间】:2019-07-07 02:32:50
【问题描述】:
Watermark 允许考虑将迟到的数据包含在一段时间内使用窗口的已计算结果中。它的前提是它会跟踪到一个时间点,在此之前假定不再有迟到的事件应该到达,但如果他们这样做了,它们仍然是discarded。
有没有办法存储丢弃的数据,以便以后用于对账? 说在我的结构化流中,我将水印设置为 1 小时。 我每 10 分钟进行一次窗口操作,并晚了 20 分钟收到了一个稍后的事件。 有没有办法可以将丢弃的数据存储在不同的位置而不是丢弃它?
【问题讨论】:
-
我看没人反驳。
-
不也是一个答案...
标签: scala apache-spark spark-structured-streaming