【问题标题】:pyspark: Is it possible to add rows to empty dataframe or rddpyspark:是否可以将行添加到空数据框或 rdd
【发布时间】:2016-06-30 14:07:27
【问题描述】:

我有一个数据框(从 hive 表创建)。我已将数据帧转换为 RDD,并且正在逐行检索。在每一行上,我正在解析每一列值,如果特定列无效,则将列名和值添加到字典中。

然后我正在检查字典是否为空。如果非空,我想将该行添加到数据框中。再次在下一行继续相同的解析。

我已经使用表架构创建了一个空数据框。是否可以将行添加到空数据框,以便最后我可以将数据框保存到 error_log_table。

否则,请建议您是否有更好的方法。我正在考虑向原始数据框添加一个新列,如果该行无效,则将该行的列值修改为“T”。通过这个我可以过滤无效的行。我不确定如何单独更新该特定无效行的新列值。

感谢您的意见和建议。

谢谢!!!

【问题讨论】:

    标签: pyspark spark-dataframe


    【解决方案1】:

    你可以使用withColumn函数

    df.withColumn(new_column_name, function_which_will_return_required_value)
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2017-06-26
      • 2010-11-06
      相关资源
      最近更新 更多