【发布时间】:2014-01-07 09:19:54
【问题描述】:
我正在与一位同事讨论 Hadoop 的 MongoDB 连接器的使用,他解释说它非常低效。他表示 MongoDB 连接器使用自己的 map reduce,然后使用 Hadoop map reduce,这会在内部减慢整个系统的速度。
如果是这样,将我的数据传输到 Hadoop 集群的最有效方法是什么?如果 MongoDB 连接器效率更低,它的用途是什么?在我的场景中,我想从 MongoDB 中获取每日插入的数据(大约 10MB)并将其全部放入 Hadoop。我还要补充一点,每个 MongoDB 节点和 Hadoop 节点都共享同一个服务器。
【问题讨论】:
-
当您的 Hadoop 节点和您的 MongoDB 节点无论如何都运行在同一个硬件上时,为什么还要担心哪个执行 MapReduce?
-
@Philipp 这对我来说都是比较新的,但我的同事告诉我的是 MongoDB 的 MapReduce 与 Hadoop 的版本不同。而且 MongoDB 的速度要慢很多。
-
根据stackoverflow.com/questions/9287585/…,我猜他的简报有一定的有效性。但我只是质疑连接器本身是否效率低下。
-
你测试并测量时间了吗?如果你没有,那只是道听途说。
-
好吧,我的连接器工作正常。我不确定如何在没有它的情况下发送数据,因为这一切对我来说仍然是新的。这就是为什么我只想检查我所学的所有东西在理论上是否有意义。否则,我真的不知道我做错了什么,或者我所做的一切是否按预期工作。