【发布时间】:2022-12-11 16:41:16
【问题描述】:
我试图在使用 pyspark 时了解 spark ui 和 hdfs ui。 以下是我正在运行的会话的属性
pyspark --master yarn --num-executors 4 --executor-memory 6G --executor-cores 3 --conf spark.dynamicAllocation.enabled=false --conf spark.exector.memoryOverhead=2G --conf spark.memory.offHeap.size=2G --conf spark.pyspark.memory=2G
我运行了一个简单的代码来读取内存中的文件(磁盘上约 9 GB)两次。并且,然后合并这两个文件并保留结果并运行计数操作。
#Reading the same file twice
df_sales = spark.read.option("format","parquet").option("header",True).option("inferSchema",True).load("gs://monsoon-credittech.appspot.com/spark_datasets/sales_parquet")
df_sales_copy = spark.read.option("format","parquet").option("header",True).option("inferSchema",True).load("gs://monsoon-credittech.appspot.com/spark_datasets/sales_parquet")
#caching one
from pyspark import StorageLevel
df_sales = df_sales.persist(StorageLevel.MEMORY_AND_DISK)
#merging the two read files
df_merged = df_sales.join(df_sales_copy,df_sales.order_id==df_sales_copy.order_id,'inner')
df_merged = df_merged.persist(StorageLevel.MEMORY_AND_DISK)
#calling an action to trigger the transformations
df_merged.count()
我预计:
【问题讨论】:
-
您要解决什么问题需要您保留此信息?
-
很乐意帮助解释,但首先我必须问你为什么要这样做,因为它会影响答案。
-
@MattAndruff 我只是想了解如何阅读 spark UI 和 hdfs 使用指标并理解它们。学习阶段。我所做的只是读取数据、持久化、读取与另一个对象相同的数据、合并、持久化结果。现在,我尝试根据参数及其对我的理解来查看监控指标。请让我知道如何帮助您更好地帮助我
标签: apache-spark hadoop pyspark google-cloud-dataproc spark-ui