【发布时间】:2023-03-16 20:50:02
【问题描述】:
我想使用 spark shell 连接来自 HDFS 的两个文件。 这两个文件都是制表符分隔的,我想加入第二列
尝试过的代码 但没有给出任何输出
val ny_daily= sc.parallelize(List("hdfs://localhost:8020/user/user/NYstock /NYSE_daily"))
val ny_daily_split = ny_daily.map(line =>line.split('\t'))
val enKeyValuePair = ny_daily_split.map(line => (line(0).substring(0, 5), line(3).toInt))
val ny_dividend= sc.parallelize(List("hdfs://localhost:8020/user/user/NYstock/NYSE_dividends"))
val ny_dividend_split = ny_dividend.map(line =>line.split('\t'))
val enKeyValuePair1 = ny_dividend_split.map(line => (line(0).substring(0, 4), line(3).toInt))
enKeyValuePair1.join(enKeyValuePair)
但我没有得到任何关于如何在特定列上加入文件的信息 请推荐
【问题讨论】:
标签: scala hadoop apache-spark