【发布时间】:2014-11-08 11:07:28
【问题描述】:
我有一个格式为class, unigram count, bigram count, sentiment 的数字数据集。我浏览了一些 Apache Mahout 文档,它们都是关于文本数据的。我知道我需要执行 3 个步骤来分类:转换为序列文件、向量化序列文件、传递它以训练朴素贝叶斯分类器。但是我很难理解在 Mahout 中对文本数据集进行分类与对数值数据集进行分类之间的区别。在我的情况下,我需要做些什么不同的事情?我将不胜感激。
【问题讨论】:
标签: java hadoop machine-learning classification mahout