【发布时间】:2017-04-16 05:34:57
【问题描述】:
我正在寻找一种可以:
- 监控新文件的 hdfs 目录并在它们出现时对其进行处理。
- 它还应该处理作业/应用程序开始工作之前目录中的文件。
- 它应该有检查点,以便在重新启动时从它离开的地方继续。
我查看了 apache spark:它可以读取新添加的文件并可以处理重新启动以从它离开的地方继续。我找不到一种方法让它也处理同一作业范围内的旧文件(所以只有 1 和 3)。
我查看了 apache flink:它确实处理旧文件和新文件。但是,一旦作业重新启动,它会再次开始处理所有作业(1 和 2)。
这是一个应该很常见的用例。我是否在 spark/flink 中遗漏了一些使它成为可能的东西?还有其他工具可以在这里使用吗?
【问题讨论】:
-
你考虑过 Apache NiFi 吗?啊,也许你更喜欢从头开始手工编码......
标签: hadoop apache-spark hdfs apache-flink bigdata