【发布时间】:2019-08-11 14:57:26
【问题描述】:
我有一组文件,所有这些文件都属于“犯罪”类别。
现在,我想将它们分类为多个(可能是重叠的)文档集群,其中每个集群都在谋杀或绑架等子类别下形成。
我想通过某种方式来识别每个文档中出现的单个单词的重要性来实现这一点。我已经尝试过使用 TF-IDF,但效果并不理想。
【问题讨论】:
标签: cluster-analysis document tf-idf
我有一组文件,所有这些文件都属于“犯罪”类别。
现在,我想将它们分类为多个(可能是重叠的)文档集群,其中每个集群都在谋杀或绑架等子类别下形成。
我想通过某种方式来识别每个文档中出现的单个单词的重要性来实现这一点。我已经尝试过使用 TF-IDF,但效果并不理想。
【问题讨论】:
标签: cluster-analysis document tf-idf
你需要监督。
诸如“嫌疑人”、“枪”之类的词可能很重要,但不会产生理想的类别。无监督的方法无法知道什么是“某种”犯罪。
【讨论】:
另一种选择是为频繁出现的单词分配权重。然后,您可以使用 k-prototypes 或 k-mode 方法对单词进行分组。
【讨论】: