【发布时间】:2020-04-11 21:39:39
【问题描述】:
我有一百万个属于不同类(100 个类)的文档。我想找到每个类中的异常文档(不属于该类但被错误分类)并过滤它们。我可以通过比较每个文档的标记来使用余弦相似度来做文档相似度。 我无法应用它来过滤给定类的错误分类文档。 示例:为简单起见,考虑 3 个类及其下的文档。
ClassA ClassB ClassC ...
doc1 doc2 doc3
doc4 doc5 doc6
doc7 doc8 doc9
我如何才能有效且高效地确定 doc4(和其他类似文档)被错误地归类到 ClassA 中,以使我的训练数据不包含异常值?
【问题讨论】:
-
类有标注吗?每个类有什么正式的定义吗?
-
没什么。阅读每个班级的文档并了解班级将是一项人力密集型任务。我尝试使用 wordcloud,但不是很清楚。
标签: python machine-learning text-classification outliers cosine-similarity