【问题标题】:emrfs sync and import gets stuck and not workingemrfs 同步和导入卡住并且无法正常工作
【发布时间】:2020-03-15 14:00:17
【问题描述】:

在使用 s3 源运行 spark 作业以及运行 emrfs sync 或 emrfs import 时,我不断收到不稳定错误。它运行了一段时间(添加了 10624 s3key)并且卡住了。此外,在等待几分钟后,Spark 读取也不会运行并引发不一致错误/异常。知道为什么会发生这种情况以及如何避免这个问题吗?

用例:从 s3 读取大约 20TB 的数据并执行排序和窗口操作。

执行的操作:

emrfs delete --metadata-name EmrFSMetaTbl s3://bucket/prefix-to-read/

emrfs import --metadata-name EmrFSMetaTbl s3://bucket/prefix-to-read/

尝试删除元数据表,但仍然出现不一致错误。 我已经尝试过Emrfs file sync with s3 not working中给出的方法

【问题讨论】:

  • 据我了解,您不必担心 emrfs-consistancy ;或手动进行任何同步。 EMR FS 将 s3 数据的元数据保存在 dynamo db 中(你可以打开你的 dynamo db,你会在那里看到一个表);我的理解:当写入 s3 时,EMR 也会写入 dynamo,如果您尝试修改/删除 s3 中的一些对象;那么 EMR fs 是不一致的。

标签: apache-spark hadoop amazon-s3 amazon-emr


【解决方案1】:

当您从 S3 中删除大量文件(我的文件几乎是几百万个非常小的文件)时,就会出现此问题,请使用以下命令将文件结构的元数据与 DynamoDB 同步。其他命令可在URL查看

emrfs sync s3://elasticmapreduce/samples/cloudfront

如果此问题反复出现,请创建一个新集群并删除 EMRFS dynamoDB 表。这解决了我的问题

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2022-11-11
    • 2013-11-08
    • 2020-12-13
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多