【发布时间】:2019-08-01 20:17:10
【问题描述】:
我有一个使用 spark 2.1(scala) 的报表统计项目,它是这样工作的:
object PtStatsDayApp extends App {
Stats A...
Stats B...
Stats C...
.....
}
有人将许多统计计算(大部分不相关)放在一个类中并使用 shell 提交。我发现它有两个问题:
如果一个统计数据卡住,那么下面的其他统计数据将无法运行
-
如果一个统计失败,那么应用程序将从头开始重新运行
我有两个重构解决方案:
- 将每个统计数据放在一个类中,但需要更多脚本。这个解决方案是否会因为提交这么多而产生很多开销?
- 并行运行这些统计信息。这个问题是资源压力,还是 spark 可以适当地处理它?
还有其他想法或最佳实践吗?谢谢
【问题讨论】:
标签: apache-spark