【发布时间】:2015-09-20 14:41:16
【问题描述】:
我有一个大数据集,用于使用 Apache Mahout 训练一个简单的分类器。我使用分类器对一堆文档进行分类(这就像我的测试集)。我对文档的分类方式如下:
我找到了测试文档的标准化 tf-idf 向量。为了找到 idf,我只考虑测试文件,而不是培训。
但是在对测试文档进行分类后,我会收到更多要分类的文档,我需要先计算新文档的 tf-idf。一种解决方案是重新计算所有测试文档(旧文档和新文档)的 tf-idf,然后将它们全部重新分类。在这种情况下,每次收到新文档时,我都需要重新计算 tf-idf。我的问题是是否有更好的解决方案来进行这种在线分类?
【问题讨论】:
标签: classification mahout text-classification document-classification