【发布时间】:2018-09-28 13:47:24
【问题描述】:
我有一个递归 spark 算法,它将 10 天的滑动窗口应用于数据集。
原始数据集是从按日期分区的 Hive 表中加载的。
在每次迭代中,都会对包含十天窗口的数据集应用一组复杂的操作。
最后一个日期然后被插入回原始 Hive 表中,下一个日期从 Hive 加载并联合到剩余的 9 天。
我意识到我需要打破火花谱系以防止 DAG 变得无法管理。
我相信我有两个选择:
- 检查点 - 涉及对 HDFS 的昂贵写入。
-
转成rdd再转回来
spark.createDataset(myDS.rdd)
使用第二个选项是否有任何缺点 - 我假设这是一个内存操作,因此更便宜。
【问题讨论】:
标签: apache-spark apache-spark-sql