【发布时间】:2020-03-24 04:28:43
【问题描述】:
我有一个来自 S3 的文本文件(实际上是多个 .gz 文件),我在下面编写了代码
val text = sc.textFile(path)
val df_text = text.map(row => row.split(",")).toDF()
但结果是这样的
+--------------------+
| value|
+--------------------+
|[id, member_id, l...|
|[1077501, 1296599...|
|[1077430, 1314167...|
|[1077175, 1313524...|
|[1076863, 1277178...|
|[1075358, 1311748...|
|[1075269, 1311441...|
+--------------------+
我不能像 "val df = spark.read.format("csv").option("header", "true").load(path)" 那样阅读它,因为当我这样阅读它时'找不到标题:
+-----------+-----------+-----------+
|1077430 |1356730 |4525526 |...
+-----------+-----------+-----------+
| 41173430| 1356730| 1456430|...
| 10237430| 1356660| 1463750|...
+-----------+-----------+-----------+
我怎样才能使它成为一个合适的DataFrame?
【问题讨论】:
标签: scala amazon-web-services amazon-s3