【发布时间】:2019-12-25 10:43:12
【问题描述】:
假设我的集群中有“10 万条记录”,而数据库(例如:MySql)中有“1 亿条记录”。
如何在不将整个 1 亿条记录物理移动到集群中的情况下,仅将这两个数据集之间的共同记录放入“dataFrame”或“RDD”中?
这些“1 亿条记录”可能每天都在增加。所以只是为了将它与“100k”的小数据集进行比较,我不想从数据库中移动整个大数据集。
“mapPartitions”在这里有什么作用吗?
【问题讨论】:
标签: mysql apache-spark apache-spark-sql