【发布时间】:2013-03-10 23:20:13
【问题描述】:
我使用 hadoop 的方式有点不同。就我而言,输入大小非常小。但是,计算时间更长。我有一些复杂的算法,我将在每一行输入上运行。因此,即使输入大小小于 5mb,总计算时间也超过 10 小时。所以我在这里使用hadoop。我正在使用 NLineInputFormat 按行数而不是块大小拆分文件。在我最初的测试中,我有大约 1500 行(拆分为 200 行),与在一台机器上串行运行相比,我看到在四节点集群中只提高了 1.5 倍。我正在使用虚拟机。这可能是问题还是对于较小尺寸的输入,hadoop 不会有太多好处?任何见解都会非常有帮助。
【问题讨论】: