【发布时间】:2018-05-04 17:33:08
【问题描述】:
我在 hdfs 中放置了一个名为 Linecount2.txt 的文本文件,并构建了一个简单的 rdd 来使用 spark 计算行数。
val lines = sc.textFile("user/root/hdpcd/Linecount2.txt")
lines.count()
这行得通。
但是当我尝试使用具有上述路径的相同文本文件时,我收到错误:
"org.apache.hadoop.mapred.InvalidInputException: Input path does not exist:"
当我查看该路径时,我可以看到创建了一个文件夹“Linecount.txt”。因此文件的路径现在是
("user/root/hdpcd/Linecount2.txt/Linecount2.txt")
然后,在定义路径后,我就可以成功运行它了。
我第三次尝试这个,我得到了同样的错误,因为输入路径不存在。
当我走过这条路时,
为什么会这样?
【问题讨论】:
-
请添加将文件放入文件夹的代码。您还没有向我们展示导致您的问题的代码。
标签: apache-spark hadoop rdd