【发布时间】:2021-11-13 06:36:49
【问题描述】:
例如,我对 spark 如何从 s3 读取数据感到有些困惑。假设要从 s3 读取 100 GB 的数据,并且 spark 集群的总内存为 30 GB。一旦触发动作,将触发读取所有 100 GB 的数据并将最大数量的分区存储在内存中,并将其余分区溢出到磁盘,或者它会仅读取它可以存储在内存中的分区处理它们,然后读取其余部分数据?任何指向某些文档的链接都将受到高度赞赏。
【问题讨论】:
标签: apache-spark amazon-s3 pyspark