【发布时间】:2015-07-31 08:29:43
【问题描述】:
我是 Spark 的新手,我尝试读取序列文件并将其用于分类问题。这是我读取序列文件的方式
val tfidf = sc.sequenceFile("/user/hadoop/strainingtesting/tfidf-vectors", classOf[Text], classOf[VectorWritable])
不知道如何按制表符分割序列文件的每一行?即如何获取 Text 值?
如何将它用于 Mllib 中的 NAiveBayes 分类器?
【问题讨论】:
标签: scala apache-spark