【问题标题】:Scalding tutorial: com.twitter.scalding.InvalidSourceException: Data is missing from one or more paths烫伤教程:com.twitter.scalding.InvalidSourceException:一个或多个路径中缺少数据
【发布时间】:2014-07-03 12:54:51
【问题描述】:

在单个节点上安装 Hadoop 2.2 后,我尝试使用以下命令运行 Scalding 教程第 1 部分:

$ yarn jar target/scalding-tutorial-0.8.11.jar Tutorial0 --hdfs

https://github.com/Cascading/scalding-tutorial/

在运行教程之前,我已将所需文件 hello.txt 复制到 HDFS:

$ hdfs dfs -ls /data
Found 2 items
drwxr-xr-x   - hdfs hdfs          0 2014-02-04 16:35 /data/10gsort
-rw-r--r--   3 hdfs hdfs         26 2014-07-03 15:07 /data/hello.txt

看起来教程找不到输入文件:

Exception in thread "main" com.twitter.scalding.InvalidSourceException:[TextLine(data/hello.txt)] Data is missing from one or more paths in: List(data/hello.txt)
at com.twitter.scalding.FileSource.validateTaps(FileSource.scala:102)
at com.twitter.scalding.Job$$anonfun$validateSources$1.apply(Job.scala:158)
at com.twitter.scalding.Job$$anonfun$validateSources$1.apply(Job.scala:153)
at scala.collection.Iterator$class.foreach(Iterator.scala:727)
at scala.collection.AbstractIterator.foreach(Iterator.scala:1156)
at scala.collection.IterableLike$class.foreach(IterableLike.scala:72)
at scala.collection.AbstractIterable.foreach(Iterable.scala:54)
at com.twitter.scalding.Job.validateSources(Job.scala:153)
at com.twitter.scalding.Job.buildFlow(Job.scala:91)
at com.twitter.scalding.Job.run(Job.scala:126)
at com.twitter.scalding.Tool.start$1(Tool.scala:109)
at com.twitter.scalding.Tool.run(Tool.scala:125)
at com.twitter.scalding.Tool.run(Tool.scala:72)
at org.apache.hadoop.util.ToolRunner.run(ToolRunner.java:70)
at JobRunner$.main(JobRunner.scala:27)
at JobRunner.main(JobRunner.scala)
at sun.reflect.NativeMethodAccessorImpl.invoke0(Native Method)
at sun.reflect.NativeMethodAccessorImpl.invoke(NativeMethodAccessorImpl.java:39)
at sun.reflect.DelegatingMethodAccessorImpl.invoke(DelegatingMethodAccessorImpl.java:25)
at java.lang.reflect.Method.invoke(Method.java:597)
at org.apache.hadoop.util.RunJar.main(RunJar.java:212)

任何想法如何使它工作?

【问题讨论】:

  • 看起来它在寻找data/hello.txt而不是/data/hello.txt,可能是这样吗?
  • 是的,在我看来也一样。但是我该如何解决这个问题?每个教程程序都可以在localhdfs 模式下工作。当--hdfs 参数给出教程代码`hadoop.util.ToolRunner.run(new hadoop.conf.Configuration, new Tool, args);` 时,应该注意将参数data/hello.txt 适当地转换为/data/hello.txt。但事实并非如此。
  • 其实data/hello.txt/data/hello.txt是不一样的。你熟悉相对路径和绝对路径吗?
  • 是的,我是。 Scalding 还附带了一个 ruby​​ 脚本scald.rb 来运行 Scalding 作业。它允许使用单个开关从本地开发切换到 hadoop 模式。这意味着将参数路径从本地转换为 hdfs 路径,例如 data/hello.txt/data/hello.txt,我假设。但我没有看到教程在哪里运行这个脚本......

标签: scala hadoop scalding


【解决方案1】:

TextLine 原来是根据给定的路径和配置构建 Hadoop 路径。

Hadoop Path API 显示“如果路径字符串以斜杠开头,则它是绝对的。”

教程我将输入固定为“data/hello.txt”,它实际上以相对路径结束。当前工作目录将被添加以形成绝对且可靠的路径。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2016-11-16
    • 1970-01-01
    • 2014-06-19
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-09-27
    相关资源
    最近更新 更多