【发布时间】:2019-08-28 20:54:38
【问题描述】:
我每天使用PySpark 中的sqlContext.read.parquet 函数来读取parquet 文件。数据有一个timestamp 列。他们将时间戳字段从2019-08-26T00:00:13.600+0000 更改为2019-08-26T00:00:13.600Z。它在 Databricks 中读取良好,但是当我尝试通过 spark 集群读取它时,它给出了 Illegal Parquet type: INT64 (TIMESTAMP_MICROS) 错误。如何使用read.parquet 函数本身阅读这个新专栏?
目前我使用:from_unixtime(unix_timestamp(ts,"yyyy-MM-dd HH:mm:ss.SSS"),"yyyy-MM-dd") 作为 ts 将2019-08-26T00:00:13.600+0000 转换为2019-08-26 格式。
如何将2019-08-26T00:00:13.600Z 转换为2019-08-26?
【问题讨论】:
-
由于 Illegal Parquet type: INT64 (TIMESTAMP_MICROS) 错误,我无法读取 parquet 文件(通过 read.parquet(path))。
标签: apache-spark pyspark apache-spark-sql pyspark-sql parquet