【发布时间】:2020-03-15 14:00:17
【问题描述】:
在使用 s3 源运行 spark 作业以及运行 emrfs sync 或 emrfs import 时,我不断收到不稳定错误。它运行了一段时间(添加了 10624 s3key)并且卡住了。此外,在等待几分钟后,Spark 读取也不会运行并引发不一致错误/异常。知道为什么会发生这种情况以及如何避免这个问题吗?
用例:从 s3 读取大约 20TB 的数据并执行排序和窗口操作。
执行的操作:
emrfs delete --metadata-name EmrFSMetaTbl s3://bucket/prefix-to-read/
emrfs import --metadata-name EmrFSMetaTbl s3://bucket/prefix-to-read/
尝试删除元数据表,但仍然出现不一致错误。 我已经尝试过Emrfs file sync with s3 not working中给出的方法
【问题讨论】:
-
据我了解,您不必担心 emrfs-consistancy ;或手动进行任何同步。 EMR FS 将 s3 数据的元数据保存在 dynamo db 中(你可以打开你的 dynamo db,你会在那里看到一个表);我的理解:当写入 s3 时,EMR 也会写入 dynamo,如果您尝试修改/删除 s3 中的一些对象;那么 EMR fs 是不一致的。
标签: apache-spark hadoop amazon-s3 amazon-emr