【发布时间】:2022-01-20 10:55:08
【问题描述】:
我正在使用 pyspark 从 EMR 读取数据。但是如果 EMR 集群被完全占用,我可以在集群管理器上看到所有内存都被某个 ETL 作业占用,我仍然可以在我的物理服务器上运行这个脚本,将数据从 EMR 集群带到我的物理服务器吗? 最佳实践建议是什么?
将数据从 EMR 读取到物理服务器需要相同的时间吗?如果在EMR上被请求读取数据,它是如何处理请求的?
通过 s3 实用程序从物理服务器访问/读取数据时,在 EMR(s3 存储桶)上执行了哪些进程?
EMR集群满了可以拉取数据到物理服务器吗?如果不是,为什么?
感谢和问候
【问题讨论】:
-
“s3 集群”是什么意思?
-
s3集群已满是什么意思?这是 Pyspark 内部的东西吗?另外,什么是“IDC 服务器”?
-
我的意思是 Amazon EMR,我重新提出了这个问题。
标签: amazon-web-services amazon-s3 pyspark apache-spark-sql amazon-emr