【发布时间】:2023-03-28 02:15:02
【问题描述】:
我的第一个表有数百万行和多列,例如:
ID Name Dept City State
11 sam sales Boston MA
22 Bob market Atlanta GA
25 Mike IT SF CA
第二个查找表包含两行数字和状态,示例如下,
No State
1 CA
2 TX
如何从第一个表中获取结果,不包括表 2 中存在状态值的行?
Spark 不支持子查询,这如何在 Spark 中完成?
【问题讨论】:
-
还有 Spark supports subqueries since 2.0.
-
我正在使用 spark 1.6
标签: sql apache-spark pyspark hiveql