【问题标题】:First N columns in dataframe using PySpark使用 PySpark 的数据框中的前 N ​​列
【发布时间】:2021-02-20 14:31:33
【问题描述】:

如何选择一个数据框中的前N列,并使其成为另一个数据框?

有 180 列的 DF,我想创建另一个具有前 105 列的 DF,而不在脚本中隐式提及列名。

【问题讨论】:

    标签: python scala apache-spark pyspark


    【解决方案1】:

    您可以从df.columns 获取列名列表,并选择列表中的前 105 个值:

    df2 = df.select(df.columns[:105])
    

    但是由于你也用 scala 标记了它,这里有一个 scala 解决方案:

    val df2 = df.select(df.columns.take(105).map(col): _*)
    

    【讨论】:

      猜你喜欢
      • 2019-03-29
      • 1970-01-01
      • 2020-08-30
      • 2021-11-29
      • 2017-09-02
      • 1970-01-01
      • 2019-04-25
      • 2016-03-21
      • 1970-01-01
      相关资源
      最近更新 更多