【问题标题】:Number of instances or the content of the instances more important (machine learning)?实例的数量或实例的内容更重要(机器学习)?
【发布时间】:2012-05-21 07:47:58
【问题描述】:

假设在文档分类领域,如果我有一个包含 1000 个实例的数据集,但实例(文档)的内容相当小;而且我有另一个包含 200 个实例的数据集,但每个实例都具有更丰富的内容。如果 IDF 不在我的考虑范围之内,那么训练实例的数量真的很重要吗?分类算法会考虑到这一点吗?

谢谢。 山姆

【问题讨论】:

  • 我不明白这个问题。考虑什么?你到底在问什么?你在想什么算法? (每个人的行为不同)你从文本中有什么特点?
  • 抱歉,如果您不清楚。我的意思是,SVM、kNN、NaiveBayes 等分类算法是否考虑了训练数据集中的实例数量?在文本分类问题中,特征将是单词或 N-gram。
  • 好的,我能理解 - 但我不明白你指的是问题中每个文档的大小。还有不止一种方法可以将单词或 N-gram 作为功能..
  • 是的,我同意的方法不止一种。如果我有一个包含许多实例的数据集 1 和一个包含少量实例的数据集 2,并且两个数据集提供的信息量相同,那么实例的数量在训练中是否重要?

标签: machine-learning classification document-classification


【解决方案1】:

您可以将此视为一般机器学习问题。可以帮助您了解训练数据大小的重要性的最简单问题是曲线拟合。

分类器或拟合模型的不确定性和偏差是样本量的函数。小样本量是一个众所周知的问题,我们经常试图通过收集更多的训练样本来避免这个问题。这是因为非线性分类器的不确定性估计是通过模型的线性近似来估计的。而这种估计只有在大量样本可用作为the central limit theorem的主要条件时才是准确的。

异常值的比例也是您在决定训练样本量时应考虑的重要因素。如果更大的样本量意味着更大比例的异常值,那么应该限制样本量。

文档大小实际上是特征空间大小的间接指标。例如,如果从每个文档中您只有 10 个特征,那么您正在尝试在 10 维空间中分离/分类文档。如果每个文档中有 100 个特征,那么在 100 维空间中也会发生同样的情况。我想你很容易看到在更高维度上分隔文档的画线更容易。

对于文档大小和样本大小,经验法则是尽可能高,但实际上这是不可能的。例如,如果您估计分类器的不确定性函数,那么您会发现样本量高于该阈值的阈值实际上不会减少不确定性和偏差。根据经验,您还可以通过蒙特卡罗模拟找到某些问题的此阈值。

大多数工程师不会费心去估计不确定性,这通常会导致他们实施的方法的行为欠佳。这对于玩具问题来说很好,但在现实世界的问题中,考虑到估计和计算的不确定性对于大多数系统来说都是至关重要的。我希望这能在一定程度上回答你的问题。

【讨论】:

    猜你喜欢
    • 2021-05-30
    • 2015-01-20
    • 2011-01-08
    • 2019-05-21
    • 2020-08-23
    • 2016-01-31
    • 2022-01-03
    • 1970-01-01
    • 2013-08-05
    相关资源
    最近更新 更多