【发布时间】:2021-12-22 11:10:01
【问题描述】:
我正在使用 pyspark 开发一个用例。 我的 pyspark 作业应该定期从 Hive 表中读取,并在其上应用一些聚合和转换。 但是我每次都无法阅读完整的表格,因为我需要将输出附加到另一个表格中。任何人都可以提出任何想法。我正在考虑的一种方法是在每个进程之后跟踪配置单元表的 rowId 或 rownum。 Ps:这不是流式用例
注意:我是 spark 新手。
谢谢, 阿尔宾
【问题讨论】:
-
很抱歉,您无法阅读整个表格的原因尚不清楚。你能解释一下吗?
-
意思是说您计算了一些聚合,但只想计算自上次运行以来添加的新值? (出于性能原因?)
-
@MattAndruff ,是的,我从中读取的表是增量表,我的 spark 作业应该定期(比如每 3 分钟)从此表中读取应用转换并保存到新表。我不应该阅读我已经处理过的行。
标签: apache-spark pyspark hive apache-spark-sql spark-streaming