【发布时间】:2019-08-22 05:14:05
【问题描述】:
使用 Scala: 我有一个emp表如下
id, name, dept, address
1, a, 10, hyd
2, b, 10, blr
3, a, 5, chn
4, d, 2, hyd
5, a, 3, blr
6, b, 2, hyd
代码:
val inputFile = sc.textFile("hdfs:/user/edu/emp.txt");
val inputRdd = inputFile.map(iLine => (iLine.split(",")(0),
iLine.split(",")(1),
iLine.split(",")(3)
));
// filtering only few columns Now i want to pull hyd addressed employees complete data
问题:我不想打印所有 emp 详细信息,我只想打印几个都来自 hyd 的 emp 详细信息。
- 我已将此 emp 数据集加载到 Rdd 中
- 我用 ',' 分割了这个 Rdd
- 现在我只想打印 hyd 寻址的 emp。
【问题讨论】:
-
代码在哪里?
-
val inputFile = sc.textFile("hdfs:/user/edu/emp.txt"); val inputRdd = inputFile.map(iLine => (iLine.split(",")(0),iLine.split(",")(1), iLine.split(",")(3))); // 只过滤几列现在我想提取 hyd 寻址员工的完整数据
-
你在 RDD 上尝试过过滤方法吗?
-
请分享代码以过滤 rdd 上的行
标签: scala apache-spark