【发布时间】:2015-12-24 04:12:48
【问题描述】:
为了从亚马逊 S3 读取/写入数据,我在使用 sparkR 配置 hadoop 时遇到了一些问题。
例如,这些是在 pyspark 中工作的命令(用于解决相同的问题):
sc._jsc.hadoopConfiguration().set("fs.s3n.impl","org.apache.hadoop.fs.s3native.NativeS3FileSystem")
sc._jsc.hadoopConfiguration().set("fs.s3n.awsAccessKeyId", "myaccesskey")
sc._jsc.hadoopConfiguration().set("fs.s3n.awsSecretAccessKey", "mysecretaccesskey")
sc._jsc.hadoopConfiguration().set("fs.s3n.endpoint", "myentrypoint")
谁能帮我解决这个问题?
【问题讨论】:
-
awsSecretAccessKey和awsAccessKeyId可以使用环境变量进行设置。见:Running Spark on EC2
标签: r hadoop amazon-s3 apache-spark sparkr