【发布时间】:2017-04-19 12:32:45
【问题描述】:
我正在使用 Java 从 Spark 中的 Parquet 文件中加载两个数据集。我需要创建一个新的作为两者的组合。在常规 SQL 中,我会加入这些表,应用一些 where 条件并创建一个新表。有没有办法在 Spark (SQL) 中实现这一点?我读到 RDD 可以实现,但我真的不想将数据写回磁盘。
【问题讨论】:
-
在 sparkSQL 中可以使用典型的连接操作,例如
join,union。等等。 -
你想要什么输出只需加入两个数据集或其他任何东西
标签: java apache-spark apache-spark-sql apache-spark-dataset