【发布时间】:2017-02-17 01:39:10
【问题描述】:
我有一个RDD[String],其中包含以下数据:
数据格式:('Movie Name','Actress Name')
('Night of the Demons (2009) (uncredited)', '"Steff", Stefanie Oxmann Mcgaha')
('The Bad Lieutenant: Port of Call - New Orleans (2009) (uncredited)', '"Steff", Stefanie Oxmann Mcgaha')
('"Please Like Me" (2013) {All You Can Eat (#1.4)}', '$haniqua')
('"Please Like Me" (2013) {French Toast (#1.2)}', '$haniqua')
('"Please Like Me" (2013) {Horrible Sandwiches (#1.6)}', '$haniqua')
我想将此转换为RDD[String,String],例如' ' 中的第一个元素将是我在RDD 中的第一个字符串,' ' 中的第二个元素将是我在RDD 中的第二个字符串。
我试过这个:
val rdd1 = sc.textFile("/home/user1/Documents/TestingScala/actress"
val splitRdd = rdd1.map( line => line.split(",") )
splitRdd.foreach(println)
但它给了我一个错误:
[Ljava.lang.String;@7741fb9
[Ljava.lang.String;@225f63a5
[Ljava.lang.String;@63640bc4
[Ljava.lang.String;@1354c1de
【问题讨论】:
-
这不是错误消息,这是一堆字符串的对象ID。
-
@Malvolio 你能告诉我如何消除该错误
-
根据
split的结果致电toList。
标签: scala dictionary apache-spark rdd scala-collections