【发布时间】:2017-07-12 00:08:36
【问题描述】:
我有一个在 Hive 数据库上运行的 scala/spark 包。它运行一个循环,其中运行查询以检查某些特定值是否存在数据
SELECT * FROM myTable WHERE col1 = 7879 AND col2= 1071 AND col3= 3027 LIMIT 1;
然后根据是否返回一行继续。执行大约需要 25 秒。
我发现这种方式比
更快SELECT COUNT(*) FROM myTable WHERE col1 = 7879 AND col2= 1071 AND col3= 3027;
并根据计数是否为 0 进行处理。
是否有更快的方法来检查表中是否存在某些约束的数据?
EDIT - 循环基于另一个查询的结果行(产生 100 多行)运行。
【问题讨论】:
标签: sql scala apache-spark hive hiveql