【问题标题】:Positives/negatives proportion in train set训练集中的正/负比例
【发布时间】:2012-05-30 20:30:53
【问题描述】:

我正在尝试获取 Rocchio algorithm 以获取相关反馈。我有一个查询,一些文件标记为正面和负面。例如,我有 60 个正面和 337 个负面。我想使用该数据集的一部分来训练我的模型(在这种情况下 - 调整查询)并在另一部分进行测试。但是拥有这种不平衡的数据集,我不确定将多少负数和多少正数带入训练集。

另一个问题是,根据测试数据集中的阳性/阴性比例,我会得到误导性的精度、召回率和 F1 分数结果。在测试数据集中有 49 个正例和 17 个负例,Precision=0.742,Recall=1.000 和 F1=0.852,TP=49,FP=17,TN=0,FN=0。

其他查询的正/负比例分布并没有给我任何关于为我的模型选择哪个比例的提示。

所以我要你的是一些关于使用不平衡数据集以获得正确结果的建议。

在此先感谢,对于这样一个菜鸟(-ish?)问题,我们深表歉意 :-)

【问题讨论】:

    标签: machine-learning information-retrieval


    【解决方案1】:

    首先,我认为你的算法很难从这么少的例子中概括出来(这当然也取决于特征的数量)。

    其次,我认为使用不平衡的数据集并不是一个好主意。 您的算法似乎没有学到任何东西,因为它的输出始终是“正数”。 这意味着如果您的数据集是平衡的,您将有 50% 的准确度。不太好... 如果您找不到更大的数据集,我建议您这样拆分:

    • 训练集(45 个正面/45 个负面)
    • 测试集(15 个阳性/15 个阴性)

    无论如何,我仍然是一名学生,所以我的想法是这样,但如果有经验的用户能够确认或确认,那就太好了。

    希望对您有所帮助!

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2014-11-27
      • 2016-08-23
      • 2017-06-27
      • 1970-01-01
      • 1970-01-01
      • 2022-01-23
      • 2017-12-12
      • 1970-01-01
      相关资源
      最近更新 更多