【问题标题】:Multi-label classification done right?多标签分类正确吗?
【发布时间】:2011-02-15 09:33:09
【问题描述】:

假设我有一个数据集,可以使用 weka 的 J48 或 R 中的 randomForest 进行整齐分类。 现在假设我有另一个训练文件,其中每个数据点包含两个分类。

如何将这两者结合起来才能将新数据点分类到这两个类别中?

(所以我需要“两次”培训。)

我应该改用 MLP(如受限玻尔兹曼机)吗?

【问题讨论】:

  • 你可以在crossvalidated.com询问
  • 当你这样做时,你应该更详细,我不太确定你的设置是什么。
  • “我的设置是什么”是什么意思?我有一个包含一堆数据的文件,其中只有一个类,另一个文件包含每个数据点提供的两个类。我想使用第一个来增强训练,并为新数据点精确匹配两个类。
  • +1 询问 Crossvalidated
  • 这两个数据集是否在同一组参数上?

标签: r machine-learning weka


【解决方案1】:

我假设你的两个数据集看起来像这样......

数据集 1:

(x_11, x_12, ... , x_1N) = 1
(x_21, x_22, ... , x_2N) = 0
....

数据集 2:

(x_11, x_12, ... , x_1N) = (1, 1)
(x_21, x_22, ... , x_2N) = (0, 1)
....

假设这就是您的问题的样子,我会将其分为两个问题:预测两个不同的标签。我认为这可以通过概率公式来证明:

p(L1,L2|X) = p(L2|L1,X)p(L1|X)

其中 L1 和 L2 是两个类标签,X 是数据。

我的建议是使用数据集 1 和 2 以及 L1 作为目标变量来训练 p(L1|X) 的模型,然后使用数据集 2 和 L1 以及 L2 来训练 p(L2|L1,X) 的模型作为您的目标变量。要预测一对新标签,您可以应用第一个模型来获得 L1 的估计值,然后使用第二个模型使用 L1 的估计值来获得 L2 的估计值。

我认为反对这种方法的一个论点是,虽然公式是正确的,但可能是 p(L1,L2|X) 比 p(L2|L1,X) 和 p(L1 |X)。但是,在没有更多细节的情况下,我真的不知道。

【讨论】:

    猜你喜欢
    • 2021-09-23
    • 2019-04-01
    • 2018-05-25
    • 2017-01-03
    • 2014-06-27
    • 2021-11-13
    • 2019-05-21
    • 1970-01-01
    相关资源
    最近更新 更多