【发布时间】:2016-04-18 05:38:57
【问题描述】:
我在同一台机器上有一个 Spark 集群和一个 HDFS。 我在每台机器的本地文件系统和 hdfs 分布式文件系统上复制了一个大约 3GB 的文本文件。
我有一个简单的字数统计 pyspark 程序。
如果我提交从本地文件系统读取文件的程序,它会持续大约 33 秒。 如果我提交从 hdfs 读取文件的程序,它会持续大约 46 秒。
为什么?我期待完全相反的结果。
在 sgvd 的请求后添加:
16 个奴隶 1 个主人
Spark Standalone,无特定设置(复制因子 3)
版本 1.5.2
import sys
sys.path.insert(0, '/usr/local/spark/python/')
sys.path.insert(0, '/usr/local/spark/python/lib/py4j-0.8.2.1-src.zip')
import os
os.environ['SPARK_HOME']='/usr/local/spark'
os.environ['JAVA_HOME']='/usr/local/java'
from pyspark import SparkContext
#conf = pyspark.SparkConf().set<conf settings>
if sys.argv[1] == 'local':
print 'Esecuzine in modalita local file'
sc = SparkContext('spark://192.168.2.11:7077','Test Local file')
rdd = sc.textFile('/root/test2')
else:
print 'Esecuzine in modalita hdfs'
sc = SparkContext('spark://192.168.2.11:7077','Test HDFS file')
rdd = sc.textFile('hdfs://192.168.2.11:9000/data/test2')
rdd1 = rdd.flatMap(lambda x: x.split(' ')).map(lambda x:(x,1)).reduceByKey(lambda x,y:x+y)
topFive = rdd1.takeOrdered(5,key=lambda x: -x[1])
print topFive
【问题讨论】:
-
它可能取决于很多事情。你的集群有多大?你用什么集群管理器?有什么自定义设置吗?什么火花版本?你能展示你的代码吗?
-
我在问题的空间里回答。
标签: performance hadoop apache-spark