【发布时间】:2021-05-06 18:10:59
【问题描述】:
我有使用以下 spark 命令读取的镶木地板文件
lazy val out = spark.read.parquet("/tmp/oip/logprint_poc/feb28eb24ffe44cab60f2832a98795b1.parquet")
很多列的列名都有特殊字符“(”。比如WA_0_DWHRPD_Purge_Date_(TOD)、WA_0_DWHRRT_Record_Type_(80=Index)我怎样才能去掉这个特殊字符。
我的最终目标是删除这些特殊字符并使用以下命令写回镶木地板文件
df_hive.write.format("parquet").save("hdfs:///tmp/oip/logprint_poc_cleaned/")
另外,我正在使用 Scala spark shell。 我是新手,我看到了类似的问题,但在我的情况下没有任何效果。任何帮助表示赞赏。
【问题讨论】:
-
@mck 我正在使用 scala,答案似乎是针对 pyspark 的,这在我的情况下不起作用
标签: apache-spark parquet