【发布时间】:2019-11-18 15:34:30
【问题描述】:
timestampbeforetimestamp after @pissall's code我有一个频率为 0.5Hz 的时间戳列,这会产生数百万行。我愿意通过每小时设置一个时间戳来减少这个数据大小。即某一天的 24 次观察。 我已经通过按年、月和日过滤数据来减少数据大小。但由于它仍然很大,我现在想将其减少到每小时一次。
我正在研究 Databricks 并使用 PySpark。
我使用以下命令将我的数据大小从几年减少到一天。
df = df.filter(df.Timestamp.between('2019-09-03 00:00:00','2019-09-04 00:00:00'))
感谢您的帮助。 谢谢
【问题讨论】:
-
您要汇总到小时数吗?
-
@pissall 是的,我想将数据汇总到小时。
-
聚合是什么?总和/平均/等?
-
@pissall 并不是真正的 sum/avg 类型的聚合。相反,我想获取(聚合)每小时而不是每秒发生的值。例如:
Time Stamp Latitude Longitude2019-09-03 00:00:00 132323 -3,545452019-09-03 00:00:01 xxxx yyyy2019-09-03 00:00:02 aaa aaa而不是我想在2019-09-03 00:00:00 2019-09-03 01:00:00 2019-09-03 02:00:00有值
标签: pyspark timestamp sampling azure-databricks