【问题标题】:Different file process in hadoophadoop中不同的文件进程
【发布时间】:2015-03-29 03:30:28
【问题描述】:

我已经安装了 Hadoop 和 hive。我可以使用 hive 处理和查询 xls、tsv 文件。我想处理其他文件,例如 docx、pdf、ppt。我怎样才能做到这一点?是否有任何单独的程序可以在 AWS 中处理这些文件?请帮我。

【问题讨论】:

    标签: hadoop amazon-web-services hive bigdata elastic-map-reduce


    【解决方案1】:

    在任何 Hadoop 平台中使用这些文件没有任何区别。为了便于访问和持久存储 - 您可以将这些文件放在 S3 中。

    【讨论】:

    • 感谢您的回复...我想知道如何对 docx、pdf、ppt 文件进行查询。
    • 我相信,有开源 API 可以从上述所有文件中交互/提取数据。您可以将它与 Hadoop / EMR 结合使用
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2012-06-24
    • 1970-01-01
    • 2012-07-13
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多