【发布时间】:2019-10-11 08:44:00
【问题描述】:
请帮助我理解 distcp 的使用,我们使用的是 s3,在一些脚本中我可以看到他们直接将数据写入 s3,并且很多情况下将数据写入 hdfs,然后使用 distcp 将数据复制到 s3。
那么什么时候使用distcp,什么时候可以直接写入云端呢?
【问题讨论】:
-
你的问题没有太大意义。您可以使用 HDFS 或 S3 来存储数据。两者都有合法的用例和不同的权衡。数据操作可以使用 Hadoop 中的完全限定路径直接寻址 S3 或 HDFS。您甚至可以将 Hadoop 配置为使用 S3 作为默认 FS。
标签: amazon-web-services apache-spark hadoop amazon-s3 pyspark-dataframes