【发布时间】:2012-11-02 20:51:45
【问题描述】:
我需要实现以下问题: 我正在获取类型的数据
public class Data{
private String key;
private String valueData;
}
我需要编写一个 map reduce 作业来获取所有 唯一 键,每个键都有一个(随机)valueData。 hadoop 听起来很简单,是的,我知道如何实现。
但真正的问题是,我还需要减少所有“similar”键。 并且输出应该是具有 dataValue
之一的类似 key 之一在 hadoop 中实现这一点的最佳方式(以及如何)是什么?我也想灵活地改变相似度算法。
【问题讨论】:
-
感谢 cmets。我只想澄清更基本的问题。当我使用 Map/Reduce 时,Reduce 得到所有相同的键和值列表。我怎样才能“更新”默认的 map reduce 键比较器,所以只有一个相似的键会出现在 Reduce 函数中?我正在寻找简单的 java Map/Reduce 代码
标签: java hadoop mapreduce cascading