【发布时间】:2017-12-20 16:25:07
【问题描述】:
我是 pyspark 的新手。想知道 pyspark 是否有一些函数可以获取 HDFS 折叠修改日期?
在 pyspark 中:
def get_user_folder_update_date():
magic()
return update_time
print get_user_folder_update_date()
2017-12-20
【问题讨论】:
我是 pyspark 的新手。想知道 pyspark 是否有一些函数可以获取 HDFS 折叠修改日期?
在 pyspark 中:
def get_user_folder_update_date():
magic()
return update_time
print get_user_folder_update_date()
2017-12-20
【问题讨论】:
您可以使用 Filesystem API 获取 HDFS 文件或目录的修改时间,然后使用 python 时间格式化函数来获取预期格式的日期。例如:
import time
path = lambda p: spark._jvm.org.apache.hadoop.fs.Path(p)
fs = spark._jvm.org.apache.hadoop.fs.FileSystem.get(spark._jsc.hadoopConfiguration())
time_ts = fs.getFileStatus(path('/tmp')).getModificationTime()
print(time.strftime("%Y-%m-%d", time.localtime(time_ts / 1000)))
【讨论】: