【发布时间】:2014-11-27 15:34:10
【问题描述】:
我正在 R 上编写一个映射器函数(使用 Rhipe 进行 map-reduce)。 mapper 函数应该读取文本文件并创建语料库。现在,R 已经有了一个名为 tm 的包,它进行文本挖掘并创建 DocumentMatrix。如果您想了解更多关于 `tm' 的信息,请查看 here。
但是在 map-reduce 中使用这个包的问题是矩阵被转换为列表,并且很难从这个混乱的“列表”中创建一个矩阵。我在 this website 中找到了一种使用map-reduce 创建语料库的算法,但我对如何找到映射器文档的名称或某些唯一标识感到有些困惑。
对于我拥有的 196MB 文本文件,hadoop 生成了 4 个映射器(blocksize=64MB)。如何对键值对进行分类,以便映射器将该对发送为((words@document),1)。这篇文章很好地解释了它。但是,我在理解映射器如何区分它在多个映射器之间读取的文档编号时遇到了一些麻烦。据我了解,映射器计数器仅针对相应的映射器。有人愿意详细说明,或提供一些关于我应该做什么的建议吗?
【问题讨论】: