【发布时间】:2014-11-29 10:37:11
【问题描述】:
我正在努力解决这样的问题。在对 Hue/Hive 执行查询后,我的输出表有 120 万个观察值。当我尝试以.csv 格式下载结果时,只能下载 100 万个观测值。我知道我可以执行查询,选择最初的 0.9 百万个观察结果并下载结果,然后执行查询以提取最后 0.3 百万个观察结果并下载结果,然后合并到例如 R 统计包中。但也许有人知道如何用一种方法做到这一点?
【问题讨论】:
我正在努力解决这样的问题。在对 Hue/Hive 执行查询后,我的输出表有 120 万个观察值。当我尝试以.csv 格式下载结果时,只能下载 100 万个观测值。我知道我可以执行查询,选择最初的 0.9 百万个观察结果并下载结果,然后执行查询以提取最后 0.3 百万个观察结果并下载结果,然后合并到例如 R 统计包中。但也许有人知道如何用一种方法做到这一点?
【问题讨论】:
您可以将限制提高到超过 100 万,但请注意它可能会减慢 Hue:https://github.com/cloudera/hue/blob/master/desktop/conf.dist/hue.ini#L741
另一种方法是执行 CREATE TABLE AS SELECT ...(这将缩放,但默认情况下不会是 CSV)
【讨论】:
对此的简单解决方案是将输出保存在 HDFS 目录中,然后从那里下载数据。使用这样的查询来存储结果:
插入覆盖目录 "$path" select * from ...
【讨论】: