【发布时间】:2020-03-10 19:54:33
【问题描述】:
我需要从 EMR 集群打开位于 S3 存储桶中的常规文本文件(不是 parquet 或 CSV 文件)。我可以直接使用spark.read.parquet("s3://mybucket/some_parq_file")直接打开CSV或parquet文件
但我只需要使用 java.io.File 或 scala.io.Source 从 EMR 集群中读取常规文本文件。当我尝试时得到一个 java.io.FileNotFoundException
import scala.io.Source
val hdr = "s3://mybucket/txtfile.txt"
for (line <- Source.fromFile(hdr).getLines) {
println(line)
}
【问题讨论】:
-
这并没有真正回答我的问题,当我直接使用 spark 时,我的 EMR 集群已经可以访问 S3 存储桶。我的问题是如何在不使用 spark 的情况下访问同一个 EMR 集群中的 S3 文件?
-
使用 java sdk。没有 emrfs 就没有简单的方法。
标签: scala amazon-s3 amazon-emr