【发布时间】:2020-02-04 22:16:57
【问题描述】:
我正在为从数据框中获取的变量赋值,如下所示:
dfScore = spark.read.format("csv").option("header", "true").load("data.csv")
level = dfScore.where((col("Name") == "Rule1")).select(dfScore ["level"])
然后我有另一个数据框,我必须添加这个级别变量值:
dfJson = spark.read.format("json").load("/mnt/coi/Rule/Rule1.json")
ScoreCal1 = dfJson.where((dfJson["Amount"] > 20000)).select(dfJson["*"])
所以我想在数据框中创建一个新列并将级别变量分配为新列值。我正在通过以下方式做到这一点,但没有成功:
ScoreCal1 = ScoreCal1.withColumn("Level",lit(level)))
如何在 pyspark 数据框中将变量分配为新列值?
【问题讨论】:
标签: python azure apache-spark pyspark databricks