【问题标题】:Limitations of multi-label classification with dynamic class set动态类集多标签分类的局限性
【发布时间】:2014-09-05 19:04:32
【问题描述】:

我手头有一个问题陈述,我需要知道它是否可以通过机器学习来解决。它是这样的:-

我有一个用户可以上传文档的系统,假设我们有一个名为 xxxZxxx.xxx

用户进入系统文件夹结构的多个级别并放置文件,(例如) A/B/C/D/Z/xxxZxxx.xxx

我们需要制作一个系统来读取文件名并建议 要放置的路径。

在这种情况下,文件名包含路径的最后一部分,这是一个业务对象目录,但它可能不包含。我们有这样的路径和文档,按 10^5 的顺序排列。

随着时间的推移,可能会添加新的路径,即业务对象,这使得这是一个多类分类,大约有 10^5 个类,并且不断增加

这可以解决吗?

我尝试使用一袋字符(灵感来自词袋)作为特征向量,但失败了。

任何可以遵循的任何方法的cmets?如果需要任何其他信息,请告诉我,我将编辑问题或更改标签。

【问题讨论】:

    标签: machine-learning multilabel-classification


    【解决方案1】:

    所以要使它成为一个真正的机器学习问题,请回答以下问题:

    1) 为什么你不能只读取文件名并获取需要放置文件的 chid 文件夹?是因为您说用户可能无法证明子文件夹的名称是文件名的一部分吗?还是因为用户提供的名称可能有很多目录?

    2) 机器学习问题通常具有统计性​​质的模式,这些模式很难用简单的肉眼识别,例如使用正则表达式。在这里,您可以使用正则表达式搜索轻松找到相应的文件夹,不是吗?

    【讨论】:

    • 您好,我已经浏览了您提到的选项。用户可能会或可能不会将文件名作为子文件夹,尽管它只是一个。这不是使用 reg-ex 可以解决的问题。我们正试图在人们的命名约定中找到一种模式,如果这样更清楚的话。
    • 所以你说用户可能会给出一个可能与已经存在的目录匹配的名称,或者它可能是一个完全不同的名称。而且您不知道用户命名约定,因此您不知道要寻找什么模式。如果上述情况属实,并且您想将其转化为 ML 问题,那么它必须是监督学习。您是否有以前的用户数据,您已经知道给定文件名的用户对应于什么目录结构?如果存在,那么我们可以进一步考虑将其视为 ML 问题,否则我认为将其视为 ML 问题的所有希望都将落空。
    • 为什么很难将其视为无监督学习问题,因为您期望(或存在)用户向您抛出的每个文件名都有 100% 正确的响应。因此,每个数据点(文件名)都有一个不同的标签(目录结构)
    • 是的,我有 6x10^5 + 记录的数据
    • 在这种情况下,我会首先推荐最简单的方法:将每个目录配置设为一个类,并为每个类训练一个对所有分类器。尝试对数据集中排名前 10/15 的类进行此操作,看看您的表现如何。然后,您可以应用其他复杂的技术,例如在此之后对类进行分组。
    猜你喜欢
    • 2013-12-15
    • 2019-04-01
    • 2018-08-04
    • 1970-01-01
    • 2013-12-20
    • 1970-01-01
    • 2017-11-01
    • 2018-10-11
    相关资源
    最近更新 更多