【发布时间】:2019-09-12 11:21:03
【问题描述】:
我正在尝试使用 SparkSQl 从 postgres 中查询大量数据。我确实在查询阶段看到了 100 个分区,但是,只有一个查询正在运行,并且只有一个执行器正在执行。
代码:
df = sqlcontext.read.format('jdbc').options(url=params['url']
,driver=params["driver"]
,dbtable=tableName
,user=params['user']
,password=params['password']
,numPartitions=numberOfPartitions
,partitionColumn=partitionC
,lowerBound=lowerB
,upperBound=upperB).load()
partitionC 是日期类型,我什至在数字列上尝试过类似的事情。我还确保数据平衡良好。
如何让spark对postgres执行多个查询?
【问题讨论】: