【发布时间】:2016-12-20 04:52:17
【问题描述】:
我想用字符串列表填充 Cassandra 数据库,然后使用 Hadoop 处理这些字符串。我想要做的是使用 Hadoop 集群按顺序遍历所有字符串,并记录每个字符串之间有多少重叠,以便找到最长的公共子字符串。
我的问题是,InputFormat 对象是否允许我按排序顺序读出数据,或者我的字符串是否会在集群中的每台机器上“随机”读出(根据 Cassandra 决定如何分配它们)? MapReduce 流程是否旨在自行处理每一行,而不会像我要求的那样连续查看两行?
【问题讨论】: