【发布时间】:2018-12-19 07:30:48
【问题描述】:
我有每天更新的表格。我用这张表进行分析。我想要一个包含 6 个月数据的静态窗口作为分析的输入。
我知道我可以在 SQL 中制作这样的过滤器,以便每次运行代码时都有 6 个月的数据。
date >= dateadd(mm, -6, getdate())
有人可以建议我如何在 PySpark 中执行相同的操作。我只能这么想:
df.filter(col("date") >= date_add(current_date(), -6)))
提前致谢!
【问题讨论】:
标签: python apache-spark filter pyspark pyspark-sql