【发布时间】:2016-07-02 15:55:09
【问题描述】:
我正在加载一个文本文件,它采用 TSV(表格分隔值)表示法,但每行中没有键。因此,一行表示一个特定的变量,随后的所有行都是该变量的值,直到出现新变量。
因此,我使用自定义分隔符加载文件(在 Jupyter Notebook Python 2.7 - Pyspark 中):
sheet = sc.newAPIHadoopFile(
'sample.txt',
'org.apache.hadoop.mapreduce.lib.input.TextInputFormat',
'org.apache.hadoop.io.LongWritable',
'org.apache.hadoop.io.Text',
conf={'textinputformat.record.delimiter': 'var::'}
)
我的问题是,这样的多行记录的大小如何?一个变量的值可能是数千行。 Spark 是在一台机器上一次加载文件还是将该块拆分为较小的块(块)然后进行处理?
只是想确保内存没有在处理节点上爆炸。感谢您的任何解释。
【问题讨论】:
标签: python hadoop pyspark hdfs