【问题标题】:Datastax Cassandra PIG Running only one MAPDatastax Cassandra PIG 只运行一个 MAP
【发布时间】:2014-05-19 14:54:28
【问题描述】:

我正在使用带有两个节点的 Datastax Cassandra 3.1.4。我正在使用 CqlStorage() 运行 pig,表中有 1200 万行,但我发现只有一个 map 运行一个简单的 pig 命令。

我尝试在我的猪关系中更改 split_size,但没有成功。

这是我的示例查询。

x = load'cql://Mykeyspace/MyCF?split_size=1000' using CqlStorage();
y = limit x 500;
dump y

我在 mapred-site.xml 中没有找到 input.split.size 属性,我假设默认拆分大小为 64*1024

我试过set pig.splitCombination false;

现在它为任何数量的记录拍摄了 513 张地图,我从 Hive 尝试了同样的事情

我已经从 Hive 连接到 Cassandra,并给出了一个简单的全选查询,其中 col1>value 这个表只有 10 条记录,但它仍在运行 513 个地图。

请帮我解决这个问题

谢谢

【问题讨论】:

标签: cassandra hive apache-pig cql datastax


【解决方案1】:

试试这个设置:

set pig.splitCombination false;

默认情况下,猪会combine what it considers small splits into a single map

【讨论】:

  • 嗨 psanford,我的目标是增加从 cassandra 读取的记录数。默认情况下,它每张地图读取 64k 行,但这里不是这样。我有大约 1200 万行,如果我将 pig.splitCombination 设为 false,它会占用 513 张地图。请帮我解决这个问题
  • 我的目标是增加从 cassandra 读取的记录数。默认情况下,它每张地图读取 64k 行,但这里不是这样。我有大约 1200 万行,如果我将 pig.splitCombination 设为 false,它会占用 513 张地图。请帮助我,现在我正在尝试从 cassandra 获取相同的蜂巢查询正在拍摄 513 张地图
  • 我猜 cassandra 属性存在一些问题,如果我能做到这一点,请告诉我,因为默认情况下,PIG 会合并小拆分而 HIVE 不会。因此,无论何时,如果小拆分或未合并,它都会运行 513 个地图。请帮我解决这个问题
  • 经过长时间的搜索,我得到了这个参数 mapred.map.tasks=513 我没有在我尝试设置 mapred.map.tasks=4 的地方设置这个参数,但它仍然没有反映
  • @sudheer 我建议就它正在拍摄的 513 张地图提出另一个问题。与单图不同的问题,单图问题已经在这里得到解答:stackoverflow.com/questions/19575475/…
猜你喜欢
  • 2013-11-03
  • 2014-09-25
  • 2013-12-26
  • 2014-10-11
  • 2015-04-18
  • 2013-07-29
  • 1970-01-01
  • 2013-02-02
  • 2018-01-29
相关资源
最近更新 更多