【问题标题】:Best practice to read data from EMR to physical server将数据从 EMR 读取到物理服务器的最佳实践
【发布时间】:2022-01-20 10:55:08
【问题描述】:

我正在使用 pyspark 从 EMR 读取数据。但是如果 EMR 集群被完全占用,我可以在集群管理器上看到所有内存都被某个 ETL 作业占用,我仍然可以在我的物理服务器上运行这个脚本,将数据从 EMR 集群带到我的物理服务器吗? 最佳实践建议是什么?

将数据从 EMR 读取到物理服务器需要相同的时间吗?如果在EMR上被请求读取数据,它是如何处理请求的?

通过 s3 实用程序从物理服务器访问/读取数据时,在 EMR(s3 存储桶)上执行了哪些进程?

EMR集群满了可以拉取数据到物理服务器吗?如果不是,为什么?

感谢和问候

【问题讨论】:

  • “s3 集群”是什么意思?
  • s3集群已满是什么意思?这是 Pyspark 内部的东西吗?另外,什么是“IDC 服务器”?
  • 我的意思是 Amazon EMR,我重新提出了这个问题。

标签: amazon-web-services amazon-s3 pyspark apache-spark-sql amazon-emr


【解决方案1】:

最佳实践是扩展您的集群并始终如一地做事。我强烈建议您不要开发带外/一次性流程,将事情转移到正常工作流程之外。

【讨论】:

  • 感谢您的回复...已经知道但需要一些可以支持的最佳实践,为什么将数据从占用的 S3 集群拉到物理服务器不是一个好主意.....跨度>
  • 我们都需要了解为什么创建多个 ETL 工具(集群/服务器)来完成相同的工作/工作是最佳实践。如果你能给我一个理由,这是一个最佳实践,我会帮助你找到一种方法来做到这一点。我认为这只会增加复杂性,并使数据沿袭更加困难,而且我认为您没有充分描述这样做的回报。
  • S3集群满了可以拉取数据到物理服务器吗?如果不是,为什么?
猜你喜欢
  • 2019-01-06
  • 2016-06-01
  • 2019-06-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2013-09-02
  • 1970-01-01
  • 2015-07-26
相关资源
最近更新 更多