【发布时间】:2021-09-19 06:04:09
【问题描述】:
jdbc(String url,
String table,
String columnName,
long lowerBound,
long upperBound,
int numPartitions,
java.util.Properties connectionProperties)
你好, 我想使用 spark jdbc 连接将几个表从 Oracle 导入 hdfs。为了确保并行性,我想为每个表选择正确的上限。我计划将 row_number 作为我的分区列,并将表的计数作为上限。有没有更好的方法来选择upperBound?,因为我必须在第一时间连接到表才能获得计数。请帮忙
【问题讨论】:
-
这里的
row_number是什么?它是预先计算的吗?或者它会在oracle查询中?如果它在查询中,那么我认为它不会是高性能的。它将比 DB 产生巨大的开销。 -
spark sql 查询中的row_number
标签: apache-spark jdbc spark-jdbc