【发布时间】:2019-07-22 05:43:17
【问题描述】:
在我的代码的某个时刻,我有两个不同类型的数据集。我需要一个数据来过滤另一个数据。假设从这一点开始无法更改代码,有没有办法在不从 report2Ds 收集所有数据并在 Spark 函数中使用它的情况下执行我在下面的评论中描述的内容?
Dataset<Report1> report1Ds ...
Dataset<Report2> report2Ds ...
report1Ds.map((MapFunction<Report3>) report -> {
String company = report.getCompany();
// get data from report2Ds where report2.getEmployeer().equals(company);
}, kryo(Report3.class));
非常感谢任何建议,甚至是对更好设计的帮助以避免此类情况。
【问题讨论】:
-
join或joinWith,可能在 typish manner
标签: java apache-spark hadoop apache-spark-sql bigdata