【问题标题】:Extracting important sub-sections and the sub set of documents associated with them from a set of documents从一组文档中提取重要的子部分以及与它们相关联的子文档集
【发布时间】:2019-08-11 14:57:26
【问题描述】:

我有一组文件,所有这些文件都属于“犯罪”类别。

现在,我想将它们分类为多个(可能是重叠的)文档集群,其中每个集群都在谋杀或绑架等子类别下形成。

我想通过某种方式来识别每个文档中出现的单个单词的重要性来实现这一点。我已经尝试过使用 TF-IDF,但效果并不理想。

【问题讨论】:

    标签: cluster-analysis document tf-idf


    【解决方案1】:

    你需要监督。

    诸如“嫌疑人”、“枪”之类的词可能很重要,但不会产生理想的类别。无监督的方法无法知道什么是“某种”犯罪。

    【讨论】:

      【解决方案2】:

      另一种选择是为频繁出现的单词分配权重。然后,您可以使用 k-prototypes 或 k-mode 方法对单词进行分组。

      【讨论】:

        猜你喜欢
        • 2013-09-20
        • 1970-01-01
        • 1970-01-01
        • 2016-02-01
        • 2018-02-02
        • 2015-10-31
        • 2016-10-16
        • 1970-01-01
        • 2019-03-17
        相关资源
        最近更新 更多