【发布时间】:2017-06-09 00:47:25
【问题描述】:
我无法将 Hive 输出保存到 S3。我已经尝试sshing 进入主节点并在 Hive 中运行我的命令,但它不保存输出。我还尝试从 AWS 的 EMR 控制台运行 Hue 中的命令,但它仍然没有保存到 S3。我还添加了脚本作为一个步骤,但它仍然没有保存。我能够获得结果的唯一方法是在 Hue 中运行它,然后单击查看结果并以这种方式下载,然后将它们推送到 S3。我不知道为什么会这样。这是我正在运行的查询。
with temp as (
select /*+ streamtable(l) */ a.id, a.name, a.page
from my_table a
join my_other_table l on (a.id = l.id)
group by a.page, a.id, a.name)
insert overwrite directory 's3://bucket/folder/folder2/folder3/folder4/folder5/folder6/folder7/'
select page, count(distinct id) over (PARTITION BY page)
from temp
group by page;
作为说明,我希望解决方案在添加步骤时起作用,因为我计划按顺序添加x 步骤数。
【问题讨论】:
标签: hadoop amazon-s3 hive amazon-emr hue