【发布时间】:2012-05-21 07:47:58
【问题描述】:
假设在文档分类领域,如果我有一个包含 1000 个实例的数据集,但实例(文档)的内容相当小;而且我有另一个包含 200 个实例的数据集,但每个实例都具有更丰富的内容。如果 IDF 不在我的考虑范围之内,那么训练实例的数量真的很重要吗?分类算法会考虑到这一点吗?
谢谢。 山姆
【问题讨论】:
-
我不明白这个问题。考虑什么?你到底在问什么?你在想什么算法? (每个人的行为不同)你从文本中有什么特点?
-
抱歉,如果您不清楚。我的意思是,SVM、kNN、NaiveBayes 等分类算法是否考虑了训练数据集中的实例数量?在文本分类问题中,特征将是单词或 N-gram。
-
好的,我能理解 - 但我不明白你指的是问题中每个文档的大小。还有不止一种方法可以将单词或 N-gram 作为功能..
-
是的,我同意的方法不止一种。如果我有一个包含许多实例的数据集 1 和一个包含少量实例的数据集 2,并且两个数据集提供的信息量相同,那么实例的数量在训练中是否重要?
标签: machine-learning classification document-classification