【问题标题】:Apache Spark: How to extract only common records from a database to clusterApache Spark:如何仅从数据库中提取常见记录到集群
【发布时间】:2019-12-25 10:43:12
【问题描述】:

假设我的集群中有“10 万条记录”,而数据库(例如:MySql)中有“1 亿条记录”。

如何在不将整个 1 亿条记录物理移动到集群中的情况下,仅将这两个数据集之间的共同记录放入“dataFrame”或“RDD”中?

这些“1 亿条记录”可能每天都在增加。所以只是为了将它与“100k”的小数据集进行比较,我不想从数据库中移动整个大数据集。

“mapPartitions”在这里有什么作用吗?

【问题讨论】:

    标签: mysql apache-spark apache-spark-sql


    【解决方案1】:

    我建议遵循以下流程。

    1. 使用 spark jdbc 将 100k 记录表导出到 RDBMS 暂存表
    2. 使用 spark jdbc 将数据导入回来,对于 spark jdbc 发送连接查询。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2017-05-07
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2019-03-17
      • 1970-01-01
      相关资源
      最近更新 更多