【问题标题】:Need a dataset with more labels (output cardinality) than features (input cardinality)需要一个标签(输出基数)多于特征(输入基数)的数据集
【发布时间】:2015-06-21 19:06:38
【问题描述】:

对于分类或回归问题,如果

'X' 是大小为 m X n 的输入矩阵 和 'Y' 是预期的输出/标签矩阵,大小为 m X k。

然后我需要一个 k >= n 的数据集。 (如果也可能,'Y' 应该是高密度标签)

这就是标签/输出的数量超过输入特征空间的地方。 你能给我推荐一个这样的数据集吗?

问候,

【问题讨论】:

  • 为什么需要这样的数据集?

标签: machine-learning dataset bigdata multilabel-classification


【解决方案1】:

Here 是很多多标签数据集,其中一个有 500 个标称属性和 983 个标签。 您还可以获取其他数据集并删除一些特征(随机或通过特征选择),以使它们的数量少于标签。

【讨论】:

    【解决方案2】:

    LIBSVM Data 上有很多这样的数据集。 它包含许多分类、回归、多标签和字符串数据集。许多来自 UCI、Statlog、StatLib 和其他集合。

    【讨论】:

      猜你喜欢
      • 2022-12-13
      • 1970-01-01
      • 1970-01-01
      • 2021-09-15
      • 1970-01-01
      • 2019-12-16
      • 1970-01-01
      • 2016-05-06
      • 1970-01-01
      相关资源
      最近更新 更多