【发布时间】:2017-02-14 05:20:07
【问题描述】:
我正在使用 PIG 和 HBASE 将一些信息存储到数据库中。我有一个从 DUMP 命令获取的数据集,它将在下一阶段存储在 HBASE 中。
DUMP somedata;
产生具有重复行的数据块,如下所示。
(rowkey, cf:1, cf:2 ....)
(12345::456::idea, 4567, deleted, 2.3, next, super)
(12345::456::idea, 4567, deleted, 2.3, next, super)
(12345::456::idea, 4567, deleted, 2.3, next, super)
(12345::456::idea, 4567, deleted, 2.3, next, super)
(12345::456::idea, 4568, deleted, 2.3, next, super)
(12345::456::idea, 4568, deleted, 2.3, next, super)
(12345::456::idea, 4568, deleted, 2.3, next, super)
(12345::456::idea, 4569, deleted, 2.3, next, super)
(12345::456::idea, 4569, deleted, 2.3, next, super)
(12345::456::idea, 4569, deleted, 2.3, next, super)
当使用 STORE 命令通过 HBaseStorage 存储一些数据时,所有重复的行都会被消除并存储不同的行。我不确定这是否是预期的行为。
上面只有它存储
(12345::456::idea, 4567, deleted, 2.3, next, super)
(12345::456::idea, 4568, deleted, 2.3, next, super)
(12345::456::idea, 4569, deleted, 2.3, next, super)
有时它确实会遗漏一些要存储的行。
谁能澄清一下?
【问题讨论】:
-
你可以添加你的代码和hbase表定义吗?
标签: java hadoop hbase apache-pig