【问题标题】:Create RDD by skipping the last line in PySpark通过跳过 PySpark 中的最后一行来创建 RDD
【发布时间】:2020-03-29 09:50:44
【问题描述】:

我正在使用 Azure Databricks 和 PySpark for Notebooks。

以下是文本文件示例Orders.txt:-

Order1|Prod1|345|3|
Order1|Prod2|45|1|
Order1|Prod3|105|2|
Order2|Prod1|345|1|
Order2|Prod4|459|2|
Order2|Prod3|105|1|
FileName|6|

我必须使用 PySpark 从下面的示例文件中创建 2 个 RDD。

1 RDD(它不应该包含最后一个文件) 2 RDD(它应该只包含最后一行)

【问题讨论】:

    标签: apache-spark pyspark databricks azure-databricks pyspark-dataframes


    【解决方案1】:

    我认为您可以为此应用过滤器。

    val skiplast = data.last
    val rows = data.filter(line => line != skiplast)
    
    val onlylast = data.last
    val rows = data.filter(line = onlylast)
    

    我无法测试它,因为我现在无法访问 Scala(我的工作已结束)。您也可以在这里找到一些有用的东西。

    https://spark.apache.org/docs/2.2.1/sql-programming-guide.html

    【讨论】:

      猜你喜欢
      • 2018-04-12
      • 1970-01-01
      • 2016-04-28
      • 1970-01-01
      • 2017-03-12
      • 2021-07-27
      • 1970-01-01
      • 1970-01-01
      • 2015-01-20
      相关资源
      最近更新 更多