【发布时间】:2020-12-12 03:42:49
【问题描述】:
我想在 PySpark 中复制 Pandas 的 between_time 函数。
是否有可能因为在 Spark 中数据帧是分布式的并且没有基于日期时间的索引?
i = pd.date_range('2018-04-09', periods=4, freq='1D20min')
ts = pd.DataFrame({'A': [1, 2, 3, 4]}, index=i)
ts.between_time('0:45', '0:15')
在 PySpark 中是否有类似的可能?
【问题讨论】:
标签: pandas apache-spark pyspark apache-spark-sql