【问题标题】:How to replicate the between_time function of Pandas in PySpark如何在 PySpark 中复制 Pandas 的 between_time 函数
【发布时间】:2020-12-12 03:42:49
【问题描述】:

我想在 PySpark 中复制 Pandas 的 between_time 函数。 是否有可能因为在 Spark 中数据帧是分布式的并且没有基于日期时间的索引?

i = pd.date_range('2018-04-09', periods=4, freq='1D20min')
ts = pd.DataFrame({'A': [1, 2, 3, 4]}, index=i)
ts.between_time('0:45', '0:15')

在 PySpark 中是否有类似的可能?

pandas.between_time - API

【问题讨论】:

    标签: pandas apache-spark pyspark apache-spark-sql


    【解决方案1】:

    如果您在 Spark 数据框中有一个时间戳列,例如 ts,那么对于上述情况,您可以使用

    import pyspark.sql.functions as F
    
    df2 = df.filter(F.hour(F.col('ts')).between(0,0) & F.minute(F.col('ts')).between(15,45))
    

    【讨论】:

      猜你喜欢
      • 2014-08-25
      • 2021-09-12
      • 1970-01-01
      • 2019-05-22
      • 2019-09-26
      • 1970-01-01
      • 2017-08-27
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多