【问题标题】:Apache Drill configuration阿帕奇钻配置
【发布时间】:2015-04-17 02:25:18
【问题描述】:

我需要为 Apache Drill(基本上是 PSV)添加存储插件,但我找不到可以添加以下行的配置文件:-

 "formats": {
   "psv": {
     "type": "text",
     "extensions": [
       "tbl"
     ],
     "delimiter": "|"
   }
}

请注意,当前在 Web 浏览器中打开本地主机 url 的解决方案是不可行的。我不想将端口和 IP 暴露给 Internet。目前我做双跳 ssh 来访问我的服务器,其中托管演习

【问题讨论】:

    标签: hadoop apache-drill


    【解决方案1】:

    您可以发布到 Drill 的 REST API:

    curl -X POST -H “Content-Type: application/json” -d ‘{ “name”:dfs, “config” {“type”: “file”, "connection": "hdfs:///", “enabled”: true, "workspaces": {"root": {"location": "/", "writable": false, "defaultInputFormat": null}}, "formats": { "psv": { "type": "text", "extensions": [ "tbl" ], "delimiter": "|" }}}’ http://localhost:8047/storage/dfs.json
    

    您还可以创建一个bootstrap-storage-plugins.json 文件,并在启动 Drill 时将其包含在类路径中,并且应该在 Drill 启动时加载。

    【讨论】:

    • 感谢您的帮助。但是我决定不使用 Apache Drill。我把它误认为是 Hive 的替代品。
    • Apache Drill 当然可以被认为是 Hive 的替代品。与 Hive 相比,Drill 没有做什么?只是好奇。
    • 我是大数据堆栈的新手,但我的理解是,Drill 是 Infobright 的替代品。在 Hive 中,您可以在运行时加载 csv,执行 map reduce SQL 查询。整体 SQL 查询将花费更多时间,因为 Hive 不会对我们已导入 csv 的表进行任何索引和处理。在练习中,我了解到您通过在配置中指定 csv 来创建数据仓库。然后,Drill 将创建它的数据存储,在它的表中复制数据,进行处理。我相信钻头会消耗更多的磁盘空间,但会非常快地执行查询。 [1/2]
    • 因此 Hive 最适合进行 Adhoc Batch 查询,但 Drill 用于实时查询...!请纠正我,我很有可能是错的。 [2/2]
    • Hive 本质上利用了 hadoop 并启动​​了 mapreduce 作业,对于批量查询非常有用。另一方面,Drill 基于 Google 的 Dremel,它对于交互式即席查询更有用。 (链接:stackoverflow.com/questions/6607552/…
    【解决方案2】:

    您也可以使用 Drill UI。 一旦 Drill 启动,Drill UI 在端口 8047(默认)上可用。 在 UI 中单击 Storage,您可以看到所有已启用和已禁用的存储插件,您可以从此处添加/创建其他存储插件。

    【讨论】:

      猜你喜欢
      • 2011-03-21
      • 2020-09-08
      • 2021-03-08
      • 2020-10-10
      • 2011-10-28
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多