【问题标题】:Implementation issue in cascading while reading data from hdfs从 hdfs 读取数据时级联的实现问题
【发布时间】:2016-08-04 11:17:31
【问题描述】:

假设我在hdfs 目录中有这些文件

500/Customer/part-001
500/Customer/part-002
500/Customer/part-003

是否可以检查元组来自哪个部分文件

注意:我研究过但一无所获。

【问题讨论】:

  • 添加示例/示例元组,以及这些文件中的数据。 . .

标签: hadoop cascading bigdata


【解决方案1】:

你的问题不是很清楚。 假设您的输出在以下布局中,并且分隔符是 ';'

身份证;姓名;年龄

1;约旦;22

2;内森;33

等等

您可以使用 awk 或 grep 或同时使用两者来获取记录

例如,如果要搜索记录 Nathan,请尝试使用文件命令

grep -r "Nathan" 部分*

上述命令将搜索字符串“Nathan”,如果该字符串存在于任何零件文件中,则输出中的第一个条目(单词)将是文件名。

如果你不想要你可以使用的文件名

grep -hr "Nathan" 部分*

提问时请说清楚。

【讨论】:

    【解决方案2】:

    我得到了如何从哪个部分文件中获取元组文件的答案。我使用下面的代码解决了我的问题。

    String fileName = flowProcess.getProperty("cascading.source.path").toString();
    

    谢谢,

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2018-12-19
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多