【发布时间】:2020-03-29 09:50:44
【问题描述】:
我正在使用 Azure Databricks 和 PySpark for Notebooks。
以下是文本文件示例Orders.txt:-
Order1|Prod1|345|3|
Order1|Prod2|45|1|
Order1|Prod3|105|2|
Order2|Prod1|345|1|
Order2|Prod4|459|2|
Order2|Prod3|105|1|
FileName|6|
我必须使用 PySpark 从下面的示例文件中创建 2 个 RDD。
1 RDD(它不应该包含最后一个文件) 2 RDD(它应该只包含最后一行)
【问题讨论】:
标签: apache-spark pyspark databricks azure-databricks pyspark-dataframes