【发布时间】:2016-10-18 15:18:12
【问题描述】:
我将加入大约 14 个表以在 Hive 1.2 中创建基表。每个表都有数百万条记录,这些是执行查询时使用的参数
hive.exec.dynamic.partition=true;
hive.exec.max.dynamic.partitions.pernode=200000;
hive.exec.max.dynamic.partitions=200000;
hive.exec.max.created.files=250000;
hive.enforce.bucketing=true;
hive.auto.convert.join=false;
mapreduce.map.memory.mb=8192;
mapreduce.reduce.memory.mb=8192;
mapred.reduce.child.java.opts=-Xmx8096m;
mapred.map.child.java.opts=-Xmx8096m;
hive.exec.dynamic.partition.mode=nonstrict;
我正在使用 ORC 文件格式,并根据 ID 对表进行分桶,并根据年、季度和月对表进行分区。该表显然在连接方面执行了大量计算。请让我知道任何其他参数或执行可用于更有效地执行连接的不同策略
【问题讨论】:
标签: hadoop join optimization hive query-optimization