【问题标题】:ERROR TypeError: 'Column' object is not callable in pyspark data frame of struct错误类型错误:“列”对象在结构的 pyspark 数据帧中不可调用
【发布时间】:2020-04-17 09:16:29
【问题描述】:

我有包含不同“Pr”的结构 PM。 我想计算 PM STRUCT 中不同元素 Pr 的 nbr。

代码

schema = StructType(
[
    StructField('PM',
        StructType([
            StructField('Pr', StringType(),True),
            StructField('Rd', StringType(),True)
    ])
    ),
    ])
df = sqlCtx.createDataFrame(data, schema)
print(df.PM.select(F.countDistinct("Pr")))

错误 TypeError: 'Column' 对象不可调用

【问题讨论】:

  • 添加示例数据框很可能有助于人们更好地理解问题。
  • @Bitswazsky 抱歉,但我的数据是机密的。但是数据框包含一个结构 pm
  • @Bitswazsky 原帖已编辑。请看一下
  • 我觉得你需要ArrayType()refer
  • @samkart 请问我可以在哪里添加?

标签: python json pyspark nested aws-glue


【解决方案1】:

类似的东西:

df.select('PM.pr').distinct().count()

【讨论】:

  • 谢谢@Steven 我试过并得到了这个错误 调用 o109.count 时出错。 Traceback(最近一次通话最后一次):
  • @ceo 这不是错误消息。您发布的消息是“出现错误”……但我们没有解决问题所需的详细信息。提供回溯。
  • 谢谢@Steven 我测试了另一个完美运行的函数。谢谢
猜你喜欢
  • 2016-09-06
  • 1970-01-01
  • 2017-02-19
  • 1970-01-01
  • 1970-01-01
  • 2020-03-08
  • 1970-01-01
  • 2021-02-23
  • 1970-01-01
相关资源
最近更新 更多