【问题标题】:Hadoop Cassandra Pig - row count query runs slow with only 1 map taskHadoop Cassandra Pig - 行计数查询运行缓慢,只有 1 个地图任务
【发布时间】:2015-04-18 15:55:04
【问题描述】:

我有一个 4 节点 Cassandra 集群,它也是一个 hadoop 集群

当我运行 pig 脚本来选择和计算 Cassandra 表的行时 - 它会创建带有 1 个地图任务的 hadoop 作业 - 完成该作业需要很长时间。

为什么 hadoop 不创建多个地图作业?

【问题讨论】:

标签: hadoop cassandra apache-pig


【解决方案1】:

最有可能的是,hadoop 输入格式生成的拆分足够大,足以覆盖您的整个令牌范围。尝试缩小输入拆分大小,以便创建更多任务。

【讨论】:

  • 默认的 cassandra.input.split.size 是 65K 行 - 我的行数是 500K+
  • SplitSize 是 Cassandra 分区,你有那么多 CQL 行或分区吗?
  • 该表有 600K 行...复制因子为 3...每个 Cassandra 节点的多节点环境也是 hadoop slave 我在地图任务日志中也看到了这一点 - INFO org.apache .hadoop.mapred.MapTask:处理拆分:拆分数:1537
猜你喜欢
  • 2014-05-19
  • 1970-01-01
  • 1970-01-01
  • 2021-11-04
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多