【发布时间】:2018-02-23 15:56:37
【问题描述】:
目前我正在尝试按最新的 date_processed 过滤 Hive 表。
表被分区。
系统 处理日期 地区
我设法过滤它的唯一方法是执行连接查询:
query = "select * from contracts_table as a join (select (max(date_processed) as maximum from contract_table as b) on a.date_processed = b.maximum"
这种方式非常耗时,因为我必须对 25 个表执行相同的过程。
任何人都知道在 Spark
这是我用来阅读的方法。
public static DataFrame loadAndFilter (String query)
{
return SparkContextSingleton.getHiveContext().sql(+query);
}
非常感谢!
【问题讨论】:
标签: apache-spark hive hdfs