【问题标题】:How to subset spark dataframe by prefixes of the column names?如何通过列名的前缀对火花数据框进行子集化?
【发布时间】:2021-01-06 14:11:21
【问题描述】:

我的 spark 数据框 df 的列名是:A_x1、A_x2、B_x1、B_x2、C_x1、C_x2。

如何使用前缀从 df 创建 3 个新的 spark 数据帧?输出应如下所示:

  • 名为 A_ 的数据框包含列 A_x1、A_x2、
  • 名为 B_ 的数据框包含 B_x1、B_x2 列,
  • 名为 C_ 的数据框包含 C_x1、C_x2 列。

谢谢!

【问题讨论】:

    标签: apache-spark pyspark apache-spark-sql prefixes


    【解决方案1】:

    您可以使用colRegex 过滤列:

    A_ = df.select(df.colRegex('`A_.*`'))
    B_ = df.select(df.colRegex('`B_.*`'))
    C_ = df.select(df.colRegex('`C_.*`'))
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2012-10-27
      • 1970-01-01
      • 1970-01-01
      • 2022-11-18
      • 1970-01-01
      • 2018-02-01
      • 2017-12-11
      • 1970-01-01
      相关资源
      最近更新 更多