【发布时间】:2019-04-10 12:40:00
【问题描述】:
我想像这样对数据框进行过滤:
filtered_df2 = filtered_df.select("li", "result.li", "fw").orderBy("fw")
但是,嵌套列result.li 与li 具有相同的名称,这会带来问题。我收到以下错误:
AnalysisException: 'Found duplicate column(s) when inserting into hdfs://...: `li`;'
如何成功过滤这两个字段?
【问题讨论】:
-
filter是什么意思?您对最终结果有何期望?一栏,还是两栏? -
能否请加
filtered_df.printSchema() -
对不起,我想我说错了。我想要的是在显示结果时分别显示所有 3 列。我之前只过滤了 DF 一行,但这不是问题
-
我现在有了解决方案。我需要使用的是 col().alias("something_else")。
标签: python apache-spark dataframe pyspark apache-spark-sql