【发布时间】:2016-02-27 15:46:21
【问题描述】:
在 spark 中,我了解如何使用 wholeTextFiles 和 textFiles,但我不确定何时使用哪个。以下是我目前所知道的:
- 在处理不按行分割的文件时,应使用
wholeTextFiles,否则使用textFiles。
我认为默认情况下,wholeTextFiles 和 textFiles 分别按文件内容和行进行分区。但是,它们都允许您更改参数minPartitions。
那么,更改分区如何影响这些分区的处理方式?
例如,假设我有一个 100 行的非常大的文件。将其处理为具有 100 个分区的 wholeTextFiles 与使用默认分区 100 将其处理为 textFile (逐行分区)之间有什么区别。
这些有什么区别?
【问题讨论】:
标签: python apache-spark pyspark