【发布时间】:2018-04-20 02:12:41
【问题描述】:
我正在尝试从 HDFS 运行这个 spark 程序,因为当我在本地运行它时,我的电脑上没有足够的内存来处理它。有人可以告诉我如何从我的 HDFS 加载 csv 文件而不是在本地加载吗?这是我的代码:
import org.apache.spark.sql.Dataset;
import org.apache.spark.sql.Row;
import org.apache.spark.sql.SaveMode;
import org.apache.spark.sql.SparkSession;
import org.apache.spark.sql.types.StructType;
public class VideoGamesSale {
public static void main(String[] args) {
SparkSession spark = SparkSession
.builder()
.appName("Video Games Spark")
.config("spark.master", "local")
.getOrCreate();
【问题讨论】:
-
spark.read().csv("hdfs://namenode:port/path/to/file.csv")应该从 csv 文件创建一个数据框。
标签: apache-spark hdfs