【问题标题】:Not getting correct result in RHadoop MAP function在 RHadoop MAP 函数中没有得到正确的结果
【发布时间】:2015-10-13 06:01:12
【问题描述】:

下面是我的文本文件内容:

name ,      tag/tags ,               location,           id
xyz,         abc;nhj;xygf;xyz;ajsd,  jhdwegyugagdwg,     T1
xasdiaos,    abcd,                   jhdwegyugagdwg0 ,   T3
xyzasihd,   jsdh;sdgwyi,             jhdwegyugagdasodpg, T2
xyzasihd,    jsdh;jadh;ahsg;sdgwyi,  jhdwegyugagdasodpg, T4

我想输出 id 和标签总数。 期望的输出如下。

T1 , 5
T3 , 1
T2 , 2
T4 , 4

我在下面为mapreduce写了一段代码。

library(rmr2)

query1= function(input, output = "/user/mtech/15CS60R13/OutputP2"){

  q1.map=
    function(., lines){
      print(lines)

      keyval(unlist(strsplit(lines,split=","))[4],
             length(unlist(strsplit(unlist(strsplit(lines,split=","))[2],split=";"))))
    }

  mapreduce(
    input = input ,
    output = output,
    input.format = "text",
    map = q1.map,
  )
}

query1("/user/xyz/file.txt")

results <- from.dfs ("/user/mtech/15CS60R13/Output")

我得到的结果如下。

print(results)
$key
[1] "T4" "T1"

$val
[1] 4 5

虽然当我尝试在map 函数中进行以下更改时,

keyval(lines,1)

我得到了所有 4 行。请解释为什么我在输入 strsplit 时只得到 2 行。

【问题讨论】:

    标签: r hadoop mapreduce rhadoop


    【解决方案1】:

    这是地图中的错误:

    q1.map=
    function(., lines){
     for(line in lines){
      keyval(unlist(strsplit(line,split=","))[4],
             length(unlist(strsplit(unlist(strsplit(line,split=","))[2],split=";"))))
    }
    }
    

    谢谢!

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2022-11-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多