【问题标题】:How to identify document categories like Movie or Biography如何识别电影或传记等文档类别
【发布时间】:2016-12-10 07:24:07
【问题描述】:

我目前正在执行一项任务,将一些文档分类为一些预定义的类集。为此,我依赖多项朴素贝叶斯,它适用于大多数类别,如棒球、运动或太空。

但是,我如何找到某个人的电影或传记等类别的文章? MNB 主要使用词袋术语方法。这就是为什么很容易检测棒球文章的原因,因为它们会包含很多棒球术语。然而,电影或传记文章包含非常少的行话。电影文档仅使用特定于该电影的词来描述或评论电影。所以一篇关于 A Few Good Men 的文章可能包含很多法律术语,这可能会导致无意中将其标记为“法律”。传记也一样,只是描述一个人的一生。

如何对这类文档进行分类?

【问题讨论】:

    标签: machine-learning naivebayes supervised-learning document-classification


    【解决方案1】:

    一个好的解决方案是使用命名实体识别半监督方法。例如,您在句子中标记了演员的名字(使用实体提取半监督方法,检查this),并获取特定实体的计数(例如:在一个句子中重复的演员(我们的实体)的计数越多,这句话与电影有关)。然后将其添加到一个特征中,因此它可能对分类器具有代表性和重要性,尝试从您的数据集中找到这些特征并将这些特征提供给您的分类器

    您可以使用Chi2ANOVA F Value 等度量来检查任何添加功能的有效性和影响

    【讨论】:

    • 我已经考虑过了。问题是,有一百万(并且不断增加)演员和女演员,我如何发现命名实体正在用于表演的上下文中?有时演员和角色的名字会交替使用,这就增加了问题。
    • 要使用半监督方法,您需要数据库中的演员姓名或与演员相关的角色,尽量在在线 api 和数据库中查找数据集
    • 啊,对,我也很害怕。问题是,有几个这样的类别。电影、历史、地理、音乐……不胜枚举!
    • 更不用说,即使完成,这也无法正常工作。例如,一篇关于 A Few Good Men 的文章只会提到汤姆克鲁斯或杰克尼科尔森的名字一次,其余的将包含他们的角色名称。根据数据库中的一次事件,显然我不能将其标记为电影,这意味着包含汤姆克鲁斯的山达基文章也将被映射为电影。所以我们必须先将汤姆克鲁斯映射到文章中他的角色名称,然后将该角色名称的所有使用都视为汤姆克鲁斯,其他人也同样如此。也许它会接近.. :(
    猜你喜欢
    • 1970-01-01
    • 2011-06-28
    • 1970-01-01
    • 1970-01-01
    • 2016-06-23
    • 1970-01-01
    • 1970-01-01
    • 2013-02-05
    相关资源
    最近更新 更多